一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

Allen AI 釋出 Olmo-core 3,主打為超大規模混合專家模型設計的開放訓練架構,官方稱可擴展至兆級參數

中文摘要

關鍵證據是在專家數從 8 擴到 128、每 token 只啟用 4 個專家的設定下,總參數從 4.6B 增至 47B,吞吐僅掉不到 5%,另在 512 卡上測試 1.2 兆參數模型。判讀範圍限於官方基準與技術報告說法,實際訓練穩定性與通用硬體表現仍待外部驗證。

一龍馬判讀

對學術單位與中小實驗室而言,它提供一套可改的開放 MoE 訓練選項,但能否真正降低兆級訓練門檻,要看程式碼成熟度與非 NVIDIA 高階卡的支援。

原文節錄

Hugging Face

It’s one of the core systems behind the next generation of Olmo

取得全文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs

收錄日期
2026-10-02
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/10/02 06:00(台北)
來源資料
官方來源