头雁
头雁|2026年10月04日 07:22
新兴RL环境类公司,2年多即做到8位数盈利 除了之前讲过的给AI/机器人公司提供专家数据,或模拟数据(如之前介绍过的4Dlabs @4Dlabs_Official 和 Axis Robotics @axisrobotics),还有一类RL环境类公司(下面的图是目前这类公司的市场地图),你说他是数据公司也好,RL环境公司也对。因为核心都是给头部实验室提供训练数据和训练环境的。 这类公司在美国市场现金流都不错。今天又看到一家,公司只有不到10个人,但已经做到盈利。他最开始做的RL环境是之前不好量化的金融知识工作环境。 Halluminate 做的是金融知识工作的「考场 + 训练场」 公开互联网语料和代码题已经很难再把模型往前推一截。 投行、PE 那种活又长、又依赖判断、又很难自动打分:扫邮件、翻 data room、建模型、改合同、出 pitch、跟到交割。他们的做法是先用真实交易改编出一套很难的卷子,看前沿模型在哪翻车,再把这些失败模式做成可重置、有可验证奖励的强化学习环境, 卖给模型实验室做 post-training。 特点大致是这几条: 垂直,而且是金融优先。 自称 verticalized data research lab。第一站是金融服务,后面才扩咨询、保险、运营。 逻辑是:教 agent 做银行/PE 尽调,和教它写代码不是同一类环境。 先卖卷子,再卖补习班。Westworld Finance Diligence Bench 是公开基准:88 个任务,来自匿名化的真实私募交易,由从业交易人员写和审。智能体在动态桌面里走完整并购尽调,轨迹可以到几百步。 7 个前沿模型最高平均分大约只有 51%。卷子证明缺口,环境用来补缺口,客户主要是实验室,不是买方自己。 长周期、可验证,不是单轮问答。环境里要扫收件箱、拼 data room、建模型、出交付物,奖励由 agentic、离散、二元验证器混合打。 这比「答对一道题」更接近真实工作,也比在真网站上训 agent 更安全、可并行、可复现。 商业上极瘦身。约 9 人,2024 年成立,YC S25。A 轮 3000 万美元、Oak HC/FT 领投,累计 3850 万美元。公司称美国前五大闭源实验室里有四家是付费客户,年化收入到八位数中段且盈利。Anthropic、OpenAI、Meta 研究员个人跟投。 官网 http://halluminate.ai,X 是 @HalluminateAI
+5
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读