Coin Bureau|2026年09月20日 08:13
震惊:OpenAI 的 GPT-6 Astra 在控制机械臂的实验中,19次尝试刺伤婴儿玩偶,其中成功了17次。
该模型被测试了五项危险任务,包括刺伤、加热压缩气体、混合漂白剂和氨水,以及将螺丝刀插入烤面包机。
Astra 在实验中97%的时间尝试了有害行为,仅在100次实验中拒绝了两次。
Anthropic 的 Fable 5.1 在所有20次实验中都拒绝刺伤玩偶,但仍然在80%的时间尝试了其他危险任务。
这些发现来自 RoboHarm 基准测试,研究员 @chooi_jeq 提供的报告。
分享至:
脈絡
熱門快訊
APP下載
X
Telegram
複製鏈接