OpenAI 发布 Deep Research:能进行多步骤互联网研究的 AI 代理

CN
1小时前

撰文:Techub News 整理

导语

2025 年 2 月,OpenAI 在其官方频道发布了一段来自东京的视频,正式介绍了其下一代智能代理产品——Deep Research。OpenAI 研究主管 Mark 与来自研究及产品团队的同事共同展示了这一新功能。此次发布之所以重要,是因为它并非简单的功能更新,而是代表了 OpenAI 在实现更强大、更自主的 AI 代理(Agent)方向上的一次实质性飞跃。Deep Research 允许模型进行长时间、多步骤的互联网研究,旨在彻底改变知识工作的范式,也是 OpenAI 通往 AGI(通用人工智能)路线图上的核心组成部分。

摘要

  • Deep Research 是一个能够进行自主、多步骤互联网研究的 AI 代理,其思考与执行任务时间可达 5 至 30 分钟。
  • 该功能基于即将发布的 O3 推理模型,通过端到端强化学习训练,具备规划、执行、根据实时信息调整策略甚至回溯的能力。
  • 其核心价值在于能替代人类完成耗时数小时的研究任务,生成带详细引用的综合性报告,覆盖市场分析、学术研究、产品选购等多种场景。
  • OpenAI 明确表示,开发能够长时间、自主执行复杂任务的代理是其 AGI 路线图的核心,Deep Research 是迈向“能够自我发现新知识”的模型的第一步。

Deep Research:重新定义 AI 的研究能力

OpenAI 研究主管 Mark 在视频开场即点明了公司对智能代理(Agents)的重视。他认为,代理将彻底改变知识工作,帮助企业优化流程、提升员工生产率,同时对消费者也至关重要。去年发布的 O1 模型开启了 OpenAI 的“O 系列”推理模型,其特点是“长时间思考”以获得更佳答案。然而,此类模型的一个局限是缺乏工具使用能力,尤其是浏览互联网这一核心工具。

Deep Research 的推出,正是为了突破这一局限。它被定义为一个能够在互联网上进行多步骤研究的模型,其过程包括发现内容、合成内容并对此进行推理,同时根据不断发现的新信息调整其计划。Mark 强调,称之为“深度”研究,是因为他们移除了模型的延迟约束。与传统模型快速返回答案不同,Deep Research 模型可能需要 5 分钟甚至 30 分钟才能给出答案。OpenAI 认为这是一个优点而非缺点,因为这标志着模型开始以无监督的方式执行更长时间的自主动作,而这正是其 AGI 路线图的核心。

“我们最终的理想是模型能够为自己发现新知识,” Mark 表示,“而第一步,就是打造一个能够去合成和理解网络信息的模型。” Deep Research 的最终产出是一份全面、带有完整引用的研究报告,堪比领域分析师或专家的作品。除了知识工作,该功能也适用于需要大量网络浏览的其他场景,例如寻找符合特定复杂条件的商品,或者为演示文稿整理素材。

OpenAI 宣布,Deep Research 将于当天晚些时候在 ChatGPT Pro 版本中推出,随后将逐步推广至 Plus、Team 以及教育和企业版用户。

实战演示:从市场分析到购物决策

为了直观展示 Deep Research 的能力,OpenAI 产品团队的 Neil 和 Josh 分别进行了现场演示。

Neil 模拟了一个产品经理的视角,希望研究是否应该开发一款新的语言翻译应用。他向 Deep Research 输入了一个复杂的查询:帮助查找 iOS 和 Android 的采用率、想学习另一门语言的人群百分比、过去几年移动渗透率的变化,并对比发达国家与发展中国家的差异,最后要求以格式化报告的形式呈现,包含表格和对 ChatGPT 最佳新兴机会的明确建议。Neil 指出,这样的查询原本需要他花费数小时手动完成。

启动任务后,Deep Research 首先返回了一系列澄清问题,例如如何定义移动渗透率、是关注整体采用率还是特定类别等。这类似于专业分析师在接手复杂项目前的需求确认环节,确保在长时间的研究开始前准确理解目标。在 Neil 给出部分指示并允许模型对其余部分做出最佳假设后,Deep Research 便开始了自主研究进程。

用户可以通过侧边栏实时观察模型的“思考”过程:它识别关键信息(如目标国家)、搜集资料、进行搜索、打开网页、阅读内容(包括图像、表格、PDF),并利用已有信息决定下一步行动。这展示了其根据上下文动态调整研究路径的能力。

与此同时,Josh 演示了一个更贴近个人生活的用例:在日本购买滑雪板。他详细描述了需求:高级装备、全山地但兼顾粉雪、因身高需要长板、以及希望有漂亮的配色方案,并要求输出为带有总结表格的报告。同样,Deep Research 在开始前询问了关于技能水平、预算等细节,在获得部分信息后便投入研究。最终,它返回了一份综合了多个网站评测信息的报告,并提供了一个对比表格。有趣的是,其首要推荐恰好是 Josh 家中已有的滑雪板型号,这从侧面验证了其研究的有效性。

两个演示任务最终都成功完成。Neil 的市场分析任务耗时 11 分钟,查阅了 29 个来源,生成了一份结构清晰、数据详实、带有图表的专业报告。用户可以直接点击查看模型中引用的每一个具体句子或段落来源。

技术内核:O3 模型与突破性评估表现

研究团队的 Isa 揭示了 Deep Research 背后的技术基础。它由 OpenAI 即将发布的 O3 推理模型的微调版本驱动。该模型通过端到端强化学习在困难的浏览和其他推理任务上进行训练,从而学会了规划和执行多步骤任务轨迹,能够根据实时信息做出反应并在必要时回溯。

最终模型具备多项强大能力:浏览用户上传的文件、使用 Python 工具进行计算和生成图表/图像(并可嵌入最终响应中)、从网站嵌入图片,以及在引用时精确到具体的句子或段落。

其性能在多项评估中取得了突破。在由人工智能安全中心和 Scale AI 发布的“人类最后考试”基准测试中(涵盖约 100 个不同学科的 3000 道简答和选择题),Deep Research 模型达到了 26.6% 的准确率新高。Isa 指出,模型的推理轨迹与人类解决问题的方式非常相似,例如在物理难题中查找科学论文中的公式,或在诗歌分析中查找其他诗作来推断格律。

在衡量智能体能力的 GAIA 基准测试(需要网络浏览、多模态、代码执行和文件推理)中,该模型也在所有三个难度级别上创造了新高。此外,OpenAI 还进行了内部专家级评估,让模型完成专家在其工作中需要数小时手动调查的任务,并由专家评定回答质量。评估结果显示两个关键洞察:首先,模型的通过率与任务的预估经济价值相关性更高,而非与预估耗时相关,说明模型认为困难的任务与人类耗时长的任务并不完全重合。其次,随着模型被允许进行更多次数的工具调用(即花更多时间思考和浏览),其性能持续提升,这验证了为代理提供更长时间以解决更难任务的路径是可行的。

OpenAI 也提到,该模型在幻觉评估上表现最佳,但仍有可能复述不准确信息,因此建议用户自行核对来源。

未来展望:通往 AGI 的自主智能体之路

在视频结尾,Mark 总结了 Deep Research 的意义,并展望了未来。他强调,2025 年 2 月发布的仅仅是冰山一角。目前是一个可以浏览网络的深度研究代理,但可以想象,未来同样的代理能够连接到自定义上下文或企业数据存储库。

Mark 再次重申,Deep Research 对于 OpenAI 的 AGI 路线图至关重要。他们相信,能够思考更长时间、更自主地解决非常困难任务的代理是发展方向。让模型能够为一个任务工作 30 分钟,实际上也激励了对更多计算资源的投入。这预示着 OpenAI 将继续沿着提升模型自主性、延长其任务执行时间和复杂度的道路前进,最终目标是实现能够自我发现新知识的通用人工智能。

免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接