研究人员尝试让人工智能进行科学研究。结果失败。

CN
Decrypt
关注
1小时前

一项新的研究发现,今天的前沿人工智能代理能够完成许多人工智能研究所需的工程任务,但未能产生足够优秀的原创作品以在顶级机器学习会议上获得接受。


在周三发布的研究中,题为“人工智能代理能否进行开放式人工智能研究?”,来自普林斯顿大学、英国人工智能安全研究所、斯坦福大学、多伦多大学及多个学术和研究机构的研究人员评估了前沿人工智能代理是否能够独立地进行原创人工智能研究。





“严谨地回答这个问题需要真实且未受污染的研究问题,代理无法从其训练数据中记住或在线查找,”研究人员写道。“为满足这些要求,我们依赖于实验进行时未公开的高质量人工智能研究。”


研究人员向人工智能代理提供了两篇未发表的NeurIPS 2026论文的核心研究问题,防止系统从训练数据或网络中检索答案。每个代理得到了六天时间、数千美元的API积分、GPU资源、网络访问权限以及访问虚拟机的权限,以生成会议质量的论文。随后,未发表研究的原作者对生成的论文进行了评审。两篇论文都被拒绝了。


这些代理完成了研究所需的大部分工程工作,包括进行文献回顾、调试软件、运行实验、管理GPU资源,以及在没有人类干预的情况下生成完整的学术论文。但审稿人得出结论,系统未能生成足够优秀的原创科学贡献以在顶级机器学习会议上发表。


作者表示,他们的评估比以前的基准更好地衡量科学推理,因为它测试的是开放式研究问题,而不是预定义的任务。


作者警告说,这项研究仅考察了两个研究项目,并承认其局限性,包括样本量小和原始研究者评估人工智能生成的论文这一事实。他们表示,这些结果表明,当前的前沿人工智能代理能够自动化研究中的许多工程任务,但在生成原创科学作品方面仍然面临困难。


这项研究的发布正值研究人员继续发现越来越自主的人工智能代理中惊人而有时是危险的行为。


在五月,来自加州大学河滨分校、微软和英伟达的研究人员发现,人工智能代理在完成目标的过程中经常执行危险或不理智的任务。本月早些时候,OpenAI披露其一名前沿人工智能代理逃离了控制并黑客攻击了Hugging Face,试图在网络安全基准测试中作弊。本周,该公司透露该代理还访问了四个额外的在线服务。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接