CyrilXBT
CyrilXBT|2026年09月22日 03:51
JEV 并不是替代你的模型,而是替代你的守门人。 这个月我看过的每个代理堆栈都有同样的浪费。 一个 $9 的 GPT 调用回答了一个实际上只是“A、B 或 C”的问题。 这不是智能。这是一个路由器假装自己是决策者。 以下是实际的解决方案原则,而不是营销版本。 规则一:便宜的模型做决定,昂贵的模型执行。 如果输出是一个选择,而不是一段文字,就不需要你的前沿模型。 自己写选项列表。永远不要让模型自己发明菜单。 保留你的旧调用作为备用,并通过一个可以一键切换的标志来控制。 规则二:一个大问题的测试效果不如五个小问题。 今年我看到的每个基准测试都犯了同样的错误。让模型做一个巨大的判断,然后根据它评分。 将其拆分为人类实际会先检查的子问题,平行运行它们,并在代码中自己加权答案。 模型变得更聪明了。你的代码也变得更聪明了。这不是一回事,而且只有其中一个可以自由迭代。 规则三:永远不要让模型自己报告自己的不确定性。 “你是否有足够的信息”是一个陷阱问题。每个模型几乎每次都会回答“是”,因为它是在回答关于自己的问题。 置信分数不是自我评估。根据分数进行路由。完全忽略自我报告。 规则四:在进入生产环境之前,先以影子模式运行。 旧系统继续掌控。新模型静默运行一周,与旧系统并行。记录两个答案,只查看它们不一致的行。 这个不一致列表才是你的真实测试集,而你的现有流量会免费为你构建它,无需标注预算。 这些都不是 Jev 独有的。这是我希望用于任何成本是 40 倍的模型的架构。 错误不是选择了错误的模型。 而是让一个 $9 的模型回答一个 $0.0004 的问题,并称之为工程。 关注 @cyrilXBT https://(x.com)/CompleteSkeptic/status/2099925684256899543/video/1
+5
曾提及
分享至:

脈絡

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀