一龍馬/AI 情報站讀懂消息背後的脈絡
星期二
搜尋

RoboHarm 在同一套雙臂機器人上測試 Claude Fable 5.1、GPT-6 Astra 與 MolmoAct2,五項危險指令由每個模型各執行 20 次,共 300 次

中文摘要

頁面報告安全拒絕次數為 Fable 20/100、Astra 2/100、MolmoAct2 0/100;Fable 的 20 次拒絕全落在刺娃娃任務,其他加熱噴罐、把螺絲起子放入烤麵包機等任務仍出現多次完成。這是五個固定場景、由人工依影片與逐字稿標註的測試;HN 留言另質疑娃娃不是真人,因此結果不能直接外推至所有真實人身危害。

一龍馬判讀

結果暴露機器人代理的語言安全護欄可能無法穩定轉化為實體行動限制,機器人供應商、部署單位與認證機構都需要把拒絕策略納入測試。任務失敗也可能來自操作能力不足,不能誤當成安全拒絕。

原文節錄

Hacker News · msadowski

Fable refused 20 of 100, Astra 2, MolmoAct2 none.

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Roboharm: Do frontier robot policies refuse unsafe instructions?

收錄日期
2026-09-22
來源
Hacker News Firebase API
抓取時間
2026/09/22 05:40(台北)
來源資料
18 分 · 6 則討論