單卡訓練千億參數模型成為可能?解析 MegaTrain 記憶體架構

在 AI 基礎設施快速迭代的今天,運算資源與模型規模之間的拉扯始終是個難題。近期 arXiv 上發表的一篇論文 … 閱讀全文 單卡訓練千億參數模型成為可能?解析 MegaTrain 記憶體架構