AI Costco,开始卖自有品牌了

CN
2小时前

作者周一笑
微信smiletalker

一个月前,我们在《深度|外宾 Genspark》一文中,把 Genspark 称作一家 AI Costco:

GPT、Claude、Gemini,谁家货好就采购谁家的,再通过模型路由和 Agent 包装以后卖给用户。连模型的产地,它过去也有点区别对待。OpenAI、Anthropic 直接摆在货架正中央,一些中国开源模型则藏得没那么显眼。

一个月后,这家 Costco 开始卖自有品牌了。

和 Costco 的 Kirkland 一样,自有品牌不等于养牛、种麦子全部都自己干。Genspark 新发布的 PPT 制作专用模型 Gen-1 Slides,以 MiniMax M3 为底座,Fireworks AI 共同参与训练。Genspark 负责提供 PPT 任务和产品运行环境,并制定评价 PPT 质量的标准。

这次还有一点不同,MiniMax M3 被明明白白写在了包装正面,出现在了官方致谢当中。

Gen-1 Slides 是 Genspark 基于 MiniMax M3 这个开源基座,通过后训练做出来的专用模型。所谓后训练,简单说就是在一个已经具备相当能力的基座上,围绕自己的任务继续训练,不用再从头训练通用大模型。Gen-1 最终用了约 2000 个内部构造的 Slides 任务做强化学习。

从 Genspark 公布的数据看,经过后训练,Gen-1 在 PPT 任务上的整体表现已与 Opus 5 处于同一水平。在 200 个真实 PPT 任务中,Gen-1 综合得分 0.821,Claude Opus 5 为 0.810;完成一份 PPT 的平均模型调用成本则分别为 0.44 美元和 4.16 美元。上线后的 157 万次生产任务里,两者平均用户评分分别是 4.25 和 4.23。

不过,不能单纯把这些数字理解成 Gen-1 已经超过 Opus。Genspark 自己的评测里,Opus 在任务完成度和内容质量上仍然更高,Gen-1 的优势更多来自视觉设计。不过,这套内部评测还有一个问题。grader 同时参与了强化学习训练,因此它的评分并不是完全独立的。为了进一步验证结果,Genspark 又用没有参与训练的 PPTEval 和 UniPPTEval 两套公开学术评测进行交叉测试,Gen-1 在九组组合里拿到八个第一。

对普通用户来说,最直观的变化是 Gen-1 已经进入 Genspark Slides 的 Standard 模式,并成为默认模型,价格不变。

对一家过去最擅长采购和组合模型的 AI 应用公司来说,Genspark 现在也不是要转向自己造模型。它仍然高度依赖外部模型和训练基础设施,只是过去主要组合 API,现在又把这种能力往模型权重上推了一层。Costco 还是那个 Costco,但货架上开始出现了一些自有品牌。

1

AI 应用,开始不满足于租模型

对 Genspark 这样的 AI 应用公司来说,一直调用最强模型是最省事的选择。模型升级就跟着换 API,一家掉队,就把任务路由给另一家。Genspark 本来也是靠这种能力起家的。

但当一种任务每天高频重复,单纯调用最强模型未必还是最好的选择。根据官方数据,Genspark 单日最多生成 12 万份 PPT。PPT 又远比问答复杂,模型要搜资料、组织结构、生成页面、渲染、检查,再根据结果反复修改。

Genspark CTO 朱凯华此前把内部的模型使用拆成三层。重复而明确的工作优先交给更便宜的模型,适合专项优化的任务通过 fine-tuning 补强,少数需要更强推理能力的节点再调用 frontier model。按照他的总结,高频、重复、定义清楚,同时拥有明确质量标准的任务,最适合专项训练。

Claude 依然很强,但通用模型的能力优势,未必就能带来最好的垂直产品体验。模型公司要覆盖广泛的任务,应用公司却可以反复观察同一类任务。这样就能知道模型在哪些特定环节出错,哪些结果会被用户接受或需要重做。

垂直 AI 创业常见的一条路径,是围绕特殊数据训练专用模型。但现在,应用公司不一定需要从零开始训练模型。更强的开源基模已经提供了通用能力。公司的任务变成了围绕具体场景继续训练,把自己的数据、评价标准和工作流程融进去。

Agent 时代,“应用公司拥有用户数据”也变得更具体。一次任务可以留下完整的执行轨迹,包括用户提出了什么要求、模型调用了哪些工具、在哪里出错,以及最终交付的结果。这些轨迹能帮助团队找到反复出现的错误,再决定应该调整工作流,还是通过训练改变模型的行为。

1

什么样的基模适合作为训练底座

Harvey 用 Qwen 做法律 Agent 的强化学习实验,Heidi Health 用开源模型训临床模型,各家选的基座不同,考虑的东西也不一样。对 AI 应用公司来说,需要的未必是一个在所有榜单上都排第一的模型。通用能力够强,又便于继续训练,反而更适合作为产品持续开发的基座。

放到 PPT 这个具体任务里,Genspark 看中的 MiniMax M3 能力也比较明确。M3 支持百万级长上下文、原生多模态,也面向 Agent 工具调用做过设计。Slides 恰好是一种长轨迹任务,模型需要在文本、视觉和工具之间不断切换,完成搜索、生成、渲染、检查和修改。

Genspark 在 Gen-1 Slides 的官方博文中提到,正因为有 M3 这样的开源基座,它才能跳过预训练,把资源集中到 Slides 的循环优化,并在几周内完成 Gen-1。也就是说,M3 把训练一个 PPT 专用模型的起跑线,直接搬到了最后几公里。

除了面向具体产品做后训练,另一种路线是在基模上继续预训练。沙特 AI 公司 HUMAIN 推出的 humain-m3,同样以 MiniMax M3 为基础,又通过超过 1 万亿 Arabic-native tokens 的进一步预训练强化阿拉伯语能力。它和 Genspark 走的是两条不同的技术路线,共同点在于都把 M3 当成了继续训练的起点。

1

模型后训练变成了一种服务

AI Coding 是较早将后训练用进产品的一类应用。Cursor 通过持续预训练和强化学习开发 Composer,法律 AI 公司 Harvey、医疗 AI 公司 Heidi Health 也开始将后训练纳入产品开发。这些公司处理的任务差别很大,但都有一些共同点,比如任务高频而相对稳定,也比较容易判断一次工作完成得好不好。

这些案例背后都出现了 Fireworks 这家公司。作为提供模型训练和推理基础设施的平台,Fireworks 降低了应用公司进入模型层的门槛。应用公司不需要自己搭起完整的模型训练体系。以 Gen-1 为例,Genspark 制定 PPT 质量标准和训练目标,Fireworks 参与算法优化和训练工程,前后进行了超过 100 次实验,有些训练轨迹长度超过 10 万 token。

这项工作也远不止提供一批训练数据。在Gen-1 的训练中,模型很快学会了利用 grader 的评分规则,有时会提高视觉评分,却同时降低任务完成质量。更具体的例子包括,模型会声称资料已经核验却没有真的核验,也会缩小字号来逃过版面溢出检测。Genspark 和 Fireworks 只能不断查看训练轨迹、调整 reward 和 grader。

为了减少 PPT 里明显的 AI 味,团队还加入了一个专门的判别器。用最终版本回测后,被判为 AI 制作的比例从 74.9% 降到了 41.7%。

做到这里,应用公司手里的优势也不只是用户数据。它还得知道自己的产品什么叫好,怎么评价,以及模型开始迎合评分体系时怎么把它拉回来。

1

不是所有 AI 应用都该做后训练

开源基模变强、Agent 工作流逐渐稳定,再加上训练门槛下降,才让 post-training 变成一条更现实的产品路线。但这些条件并不意味着所有 AI 应用都应该做后训练。

Manus 早期就做过另一种选择。项目启动时,团队认真讨论过是否基于开源模型训练一个端到端 Agent,最后把主要精力放在 context engineering 上。Manus 联合创始人兼首席科学家季逸超当时认为,对于快速变化、尤其还没有找到 PMF 的应用,几周一次的训练迭代跟不上产品变化,底层模型的进步也可能很快让已有训练贬值。

从 Manus 此后的公开产品路线看,它目前仍把大量改进放在 Agent 架构、上下文、工具和工作流上。今年推出的 Projects That Learn From Every Task,也是把一次任务中可复用的经验写回 instructions、files 和 skills,没有去碰模型权重。

而 Slides 这类场景,已经具备相对成熟的工作流。任务规模大,产品形态稳定,有明确的交付质量标准,再选择把长期积累的经验训练进模型,收益才更明确。

Genspark 和 Manus 的不同选择,也说明后训练有自己的适用边界。还在快速试错的 Agent 产品,更适合跟着基模升级,继续优化上下文和执行框架;已经形成稳定工作流的垂直应用,则更有条件把优化做到模型参数这一层。

但一个训练好的模型本身也很难成为长期壁垒。更强的基模出来以后,应用公司可能需要重新训练,相比某一个具体模型版本,能够跟着迁移的评价体系和训练流程,价值更大。

1

开源模型开始卖可训练性

这里说的可训练性,首先得能训。最基本的问题是,模型权重和许可证是否允许继续训练,SFT、偏好优化、强化学习能不能直接跑,现有训练平台是否已经支持这个模型,这些都会影响一家应用公司能不能把后训练真正做起来。Fireworks 的训练产品里,就会直接列出不同基模支持的训练方式、上下文长度和训练规格。

基模本身的能力也得足够强。一个模型再开放,如果通用能力太弱,或者和业务需要的能力差得太远,后训练很难补课。法律、代码、PPT 各自需要的能力组合不同,应用公司挑选的考量也会不同。

训练完成之后,还要考虑能不能长期整合进产品。模型大小、吞吐、延迟、推理成本,以及部署和训练基础设施是否成熟,都会影响这套方案最终是否划算。Harvey 在法律场景做 post-training 时,甚至会把 token 消耗写进 reward,提高任务表现的同时控制推理成本。

可训练性最后其实落在三个问题上:能不能训,值不值得训,训完以后能不能用得起。

闭源模型公司也在争这部分需求。OpenAI 已经提供强化微调等能力,所以应用公司的选择不会简单变成开源和闭源二选一。对开源模型来说,除了直接提供能力,能不能成为一个好用的训练起点,也开始影响下游的选择。

一个模型能被多少产品直接调用是一种规模,能成为多少产品继续训练的底座,可能是另一种。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接