头雁|2026年10月06日 07:25
Reflection @reflection_ai 的创始人参加的播客访谈,谈他要像我们的梁圣学习,打造西方的 DeepSeek
Alex Heath 的 Sources 播客访谈(约 62 分钟):嘉宾是 Reflection 两位联合创始人:CEO Misha Laskin(曾负责 Google Gemini 的奖励建模)和 CTO Ioannis Antonoglou(参与过 AlphaGo、AlphaZero,并主导 Gemini 的 RLHF)。核心是公司即将发布的首个开源权重模型 Beam,以及他们想做“西方的 DeepSeek”。
开源模型为什么突然热起来:
他们用房地产比喻:闭源模型像租房,开源权重才算“拥有”智能。AI 商业市场才大约三年,西方长期只有租赁选项;随着企业和应用公司长大,所有权、可控、可定制变得更重要。他们提到 OpenRouter 等平台上,开源 token 占比已从大约 30% 翻到大约 70%。另外,中美地缘因素也在推这件事。
Reflection 的起源故事: 两人在 DeepMind 共事,Ioannis 曾是 Misha 的上司,一起做 Gemini 1 / 1.5,Ioannis 负责 RLHF。公司最初有两个赌注:RL 能做出编码和 agent 能力;西方会有强开源底座可以接着做研究。前一个赌对了,后一个在 DeepSeek V3 后落空,等了几个月没有同等西方开源模型,于是改做自己的模型。起源是纽约冲刺期间一次尴尬的喜剧 cellar 和龙虾卷晚餐,Ioannis 先提出一起创业。Nvidia 是重要投资人,也支持开源,但是他们自己得出要走开源的结论,不是 Jensen 推的。融资超过 20 亿美元量级,当时已知估值大约 250 亿美元。
为什么中国开源领先:
他们认为西方早期由商业驱动,闭源租金模式先发展起来;Llama 3 之后缺少继续做顶级开源的商业激励。中国实验室则更多受地缘政治推动,DeepSeek V3 是转折点,把中国开源智能推到全球相关位置。现在市场成熟后,这些实验室也开始有收入。
Beam 是什么:
约 5000 亿总参数、230 亿激活参数的 MoE 模型,从零预训练,不是蒸馏。定位是编码、推理和 agent,公开基准上对标最强开源模型,强调推理 token 效率(他们称可比部分开源前沿模型以及 GPT 类模型高效数倍)。目标用户是企业、公共部门和主权客户,作为可自托管的“主力模型”。技术上他们把强化学习算力拉到很高(提到约 1 万张 GB300 跑数周),认为这是把较小模型里的智能挤出来的关键。
从零开始训练:
不是蒸馏。原因有二:要做成真正由西方团队从零建出来的前沿开源模型;大规模 RL 要稳定,必须自己掌控预训练。预训练数据要先种下推理能力,MoE 的路由和专家在高算力 RL 下还得保持平衡,所以端到端自己训才能在较小体量里塞进足够智能。去年11月,从零开始组建了预训练团队,只有5个人。
安全与开放:
他们主张开放更安全,类比 Linux、加密协议和 Linus 定律:漏洞要靠大量外部目光才能被找出来。闭源实验室安全研究员太少,类似“白细胞不够”。他们也承认能力到一定阈值时,无论开源还是闭源都应受监管、限制发布;Hugging Face 被攻击后转向开源模型做防御,被他们当作生态互补的例子。对齐方法与闭源实验室类似:评测、SFT、RL,在有用和拒绝之间做权衡。
公司与商业模式:
两人在 DeepMind 合作做 Gemini 后创业,原本押注强化学习和已有西方开源底座;DeepSeek 之后西方开源前沿后退,他们改成自己从零做模型。融资约 46 亿美元(Nvidia、Sequoia、Lightspeed 等;访谈中也提到估值和算力协议,包括 Nebius、SpaceX)。
赚钱逻辑不是卖权重本身,而是开源模型带动推理和企业需求:帮企业、政府和盟国部署推理、agent、集群与安全工具,做“拥有自己智能”的全栈伙伴。长期可能垂直整合算力以提高利润;收入大致等于智能密度 × 可控算力 × 客户信任。
合作与下一步:
提到韩国约 250 兆瓦数据中心、与 Dell 等基础设施伙伴合作:对方提供土地、电力和裸金属,Reflection 提供模型和其上的软件栈。分发不只是丢上 Hugging Face,还会配套开源工具并接入云和推理商。2027 年计划出明显更大的模型,并像其他实验室一样在同一底座上做多轮 RL 迭代,目标是把开源与闭源前沿差距收掉。
Reflection 接下来做什么:
使命是抹平开源与闭源前沿的差距。2027 年会出明显更大的模型,并继续加大 RL;同一底座上会像别人的 5.1、5.2 那样多轮发布。下一代已经在做。他们把这次 RL 视为开源里规模最大的一次,约 1 万张 GB300 跑了数周,而且学习没有停,瓶颈在算力。科学突破已经做出,接下来是把规模化做得更高效,并把收益通过多极、透明和建设者生态分发出去。
https://sources.news/p/reflection-founders-open-weight-beam-release
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接