一龍馬/AI 情報站讀懂消息背後的脈絡
星期六
搜尋

Doug Turnbull 提出一個反直覺的分類流程

中文摘要

不要每次把完整合法分類詞表塞進 LLM,而是請較便宜的小模型先「編」出看似合理的假分類,再用這個假分類的向量去比對真實 taxonomy。原文用 Wayfair WANDS 電商資料集舉例,查詢「brown coffee table」可先生成類似但不合法的路徑,再用 MiniLM embedding 與真實分類做 dot product,對回「Furniture / Living Room Furniture / Coffee Tables & End Tables / Coffee Tables」。HN 討論裡,作者補充這套用 Nano model 比把完整詞表交給較大 OpenAI 模型「稍差一點」,但比完全不分類好;多位留言也提醒 embedding 排序常只能當 shortlist,重要查詢仍需要人工或更強模型覆核。

一龍馬判讀

對搜尋、電商與客服分類系統來說,這改變的是成本結構:不用每次傳大 schema,也能把小模型納入流程。風險在於錯誤會來自 LLM 生成與向量近鄰兩段,若把它當成保證正確的分類器,會在高價值查詢上出事。

原文節錄

Hacker News · softwaredoug

--> Don't fill this out if you're human: Doug's search blog and newsletter Subscribe Learn more Check your email to confirm your subscription Doug Turnbull

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Don't classify, hallucinate

收錄日期
2026-08-15
來源
Hacker News Firebase API
抓取時間
2026/08/15 05:40(台北)
來源資料
198 分 · 81 則討論