Jiayuan (JY) Zhang
Jiayuan (JY) Zhang|2026年09月18日 09:03
一些关于 Jev 的 notes 研究了一天 Jev,带来的新鲜感迅速回落,这好像就是一个更快的通用分类器/决策器,LLM 完全可以做到。 而且因为不了解模型背后的参数规模(应该不会很大),世界知识可能不一定有常规 LLM 那么全,在这种情况下,它的复杂场景的决策结果是不是真的准还是要打一个问号的。 在一些有限解空间 + 低延迟要求的问题上,Jev 可能是一个很好的方向,加上形式化输出从程序上保证了正确性。 一个最常见的场景就是 Computer Use,太适合 Jev 了,网页的 Dom 元素是一个有限集,完全可以让 Jev 来做操作,这里面的 loop 相当于是 dom list -> jev action -> new dom list 这样的循环,但是这里 Jev 的推理能力和长上下文情况下的 computer use 效果如何还不清楚,目前还没有看到 benchmark(直观判断肯定是不如 GPT 6 Astra 的,但是速度太快了)。 昨天有尝试把 Pi Agent 中间的一些模块用 Jev 来重写一下,发现可以优化的地方不是特别多,tool using 部分的选择还是不能用 Jev 来代替,因为这不是一个有限集(每一步 tool using 实际上带了很多参数,比如 edit tool,会有具体的 lines 等参数,这部分是需要模型推理出来的,没有办法提前加到 Jev 的决策列表中),但是有一些地方是可以的,比如说 Compaction,可以让 Jev 快速做分类器(LLM 也能做,这里面差异化不太大)。 另外一类场景是依赖决策树逻辑的,例如: - 游戏 AI - 机器人 - 自动驾驶 而且这些场景对实时性要求比较高,传统的 LLM 来做这些事情的一个很大问题就是太慢了(plus 很大一部分场景是缺乏数据来训练的)。 目前正在做的两个 demo: 1. Poker AI,Poker 非常适合这个场景,而且决策树非常长 + 复杂,正在用 Jev 和其他模型做对抗式 battle。(btw 传统的 GTO Wizard 用来做训练实在是太难用了) 2. Pokemon VGC AI,这是严肃的宝可梦双打对战,有世界锦标赛的那种,每个赛季都有对应的规则,因为数据很全,所以非常适合用来研究 AI 的决策,plus 之前竟然没有一个很好的用来个人训练的 AI(这个做完了打算用这个 AI 实际在 Pokemon Champion 排位赛里用一下)。 这两个 demo 场景都是偏回合制的,其实用 LLM 也能做。
+5
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读