一龍馬/AI 情報站讀懂消息背後的脈絡
星期二
搜尋

作者也明說限制:目前 Harbor 整合只支援線性 agent trajectories,尚不支援 summarization/compaction 或非線性軌跡

中文摘要

Castform 宣布支援 Harbor,主張使用者可以把 Harbor 定義的任務、agent harness 與 reward function 直接接到 Castform 做 RL 訓練,範例展示以 `harveyai/lab` dataset、Modal sandbox 與 Harvey harness 建立訓練環境。文章的核心技術點是用 proxy gateway 維持 token-in-token-out(TITO):trainer 端處理 token,harness 端仍走標準 OpenAI chat message 格式,gateway 負責比對文字歷史、追蹤 token cache、串流解碼與工具呼叫處理。作者也明說限制:目前 Harbor 整合只支援線性 agent trajectories,尚不支援 summarization/compaction 或非線性軌跡。

一龍馬判讀

這降低了把正式環境中的 agent harness 拿來做 RL 訓練的重寫成本,對正在訓練 coding agent、工具型 agent 的團隊有直接用處。風險在於 gateway 要處理 tokenizer、工具呼叫、串流與多模態邊界案例,若實作不穩,訓練資料與實際部署行為仍可能漂移。

原文節錄

Hacker News

train on harbor tasks with castform - castform blog c a s t f o r m pricing docs learn blog careers start training book…

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Token-in-token-out RL training with any agent harness, via a proxy gateway

收錄日期
2026-08-18
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/18 06:00(台北)