a16z|2026年09月09日 14:48
Vals AI联合创始人兼CEO Rayan Krishnan与a16z的Ben Horowitz和Jennifer Li一起探讨如何评估AI、成本问题以及谁来制定规则:
每个大型行业最终都会发展出一个独立的测试层。AI可以从信用评级中学习,也可以避免像Enron这样的错误。如今,模型能力大多是自我报告的。
随着公共基准测试饱和,模型变得更擅长优化测试本身,Rayan提出了独立且不断发展的评估的重要性。
更难的问题是地缘政治。里根的“信任但验证”在冷战时期奏效,因为你可以飞过去数导弹。而AI模型没有简单的等效方式。
在与Erik Torenberg的对话中,他们深入探讨了如何衡量模型自我改进的能力、为什么每个好的基准最终都必须被淘汰,以及当代币花费开始与员工薪资相当时会发生什么。
00:00 引言
02:20 Llama 4关于公共与私人基准测试
05:24 人类测试标准也没人达成一致
06:55 电影评级教会我们关于AI的什么
08:55 基准测试中的Enron问题
11:36 为什么好的基准必须被淘汰
13:22 运行数周而非数秒的评估
16:20 真正的工作日从下午4点开始
18:08 一家公司实际上只是它的评估
20:35 为什么Sonnet可能比Opus更贵
22:42 一位工程师一天处理60亿个代币
25:05 谁应该为模型制定规则
28:55 公共部门执行,私人部门验证
33:32 为什么主权AI效率低但仍在发生
35:00 AI版的信任但验证
37:15 网络评估的下一步方向
YouTube: https://www.(youtube.com)/watch?v=WO9c9qxDxzU
@RayanKrishnan @ValsAI @bhorowitz @JenniferHli @eriktorenberg
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接