一龍馬/AI 情報站讀懂消息背後的脈絡
星期一
搜尋

llm.vhdl是以VHDL在FPGA織構上跑Transformer推論的開源專案,作者設定以9B單卡、27B雙晶片為目標

中文摘要

專案文件稱全部乘法由INT4 streaming matvec引擎負責,權重、快取與狀態放在卡上HBM,並以llama.cpp與位元精確模型對照驗證。依文件說法,9B已在兩張FK33以管線分工實機運作,作者量測約每秒2.5 tokens且實機僅驗證75MHz;27B放在Jungle Cat雙晶片仍是目標,受互連參考時脈缺件、權重載入路徑與集合通訊未完成阻擋,單模組200MHz只是獨立佈線靜態數據,並非全機運作時脈。

一龍馬判讀

對想研究GPU之外推論硬體的使用者而言,專案提供可檢驗的程式碼與驗證流程,但建置門檻高、速度慢,短期偏向硬體實驗而非實用部署。

原文節錄

Hacker News

This roughly doubles decode throughput over one card (about 2.5 tokens/s measured).

取得全文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Full-fabric VHDL LLM inference engine. Runs Qwen3.5-class transformer inference

收錄日期
2026-10-05
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/10/05 06:00(台北)