一龍馬/AI 情報站讀懂消息背後的脈絡
星期六
搜尋

Doubleword 的技術文拆解 RTX 4090 上一次 GPU global load 從 warp 發出後

中文摘要

如何經過暫存器讀取、coalescer、L1 cache、位址轉譯、crossbar、L2 slice,最後在快取未命中時抵達 DRAM。作者以一個簡單的 CUDA vector-add kernel 為例,追蹤 SASS 指令 LDG.E,並說明一次 32 lanes 各讀 4 bytes 會被合併成 4 個 32-byte sector、1 條 cache line 等硬體動作。原文強調許多細節 NVIDIA 沒有公開到足夠層級,因此是靠硬體 timing experiment 反推;HN 回應則多是讀者讚賞深度、詢問 PCIe/BAR 是否相關,以及有人補充這篇主要談 VRAM/HBM/GDDR 路徑。

一龍馬判讀

對寫 CUDA kernel、推論框架或低階效能調校的人來說,記憶體路徑常比算術單元更決定瓶頸,理解 coalescing、cache 與延遲才有機會把效能榨出來。限制是文章以 RTX 4090 為實驗平台,作者也明說更貼近生產環境的 GPU 還要另看,不能直接外推到所有 NVIDIA 加速卡。

原文節錄

Hacker News · ibobev

What happens when a GPU reads memory | Doubleword ← August 13, 2026 Inference API API What happens when a GPU reads memory Fergus Finn…

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

What happens when a GPU reads memory

收錄日期
2026-08-22
來源
Hacker News Firebase API
抓取時間
2026/08/22 05:40(台北)
來源資料
77 分 · 15 則討論