一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

這篇教學文記錄作者用 Unsloth 對 Qwen 3 4B 做 continued pretraining,讓本機小模型學會一個虛構城市 Awesomeville 的旅遊顧問任務

中文摘要

作者採 LoRA 而非全量訓練,說明在其設定中只訓練 6,600 萬參數、約占 4B 模型的 1.6%,並把重點放在地鐵路線與景點的推理,而不是背誦固定問答。文章也坦承資料集製作是最耗時的部分:一開始用 agent 合成到 1 萬筆資料,結果語言模板化、偏向記憶特定路線,遇到未見案例表現不佳,後來改採更有針對性的資料設計。

一龍馬判讀

它提供一個比單純 RAG 更貼近模型內化領域規則的個人實驗案例,對想在消費級硬體上客製小模型的人有參考價值。限制是領域是虛構城市,文章屬經驗分享,不能直接代表 CPT 在真實企業知識或高風險決策中可靠。

原文節錄

Hacker News

As an interesting experiment I wanted to learn how to teach a tiny local llm a new domain by doing Continued Pretraining (CPT) on domain

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Teaching a local LLM to reason about a new domain through continued pretraining

收錄日期
2026-08-21
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/21 06:00(台北)