Zhixiong Pan|2026年10月03日 07:36
AI Agent 的 Coding 能力,我觉得最近可能真的跨过了一个临界点。
至少在某些非常硬核的软件工程任务上,它已经开始超过绝大多数人类工程师,甚至能进入过去只有少数专家才能做好的领域。
一两个月前,我曾经让 Opus 5、Fable 5,以及 GPT-5.6 / GPT-6 去优化同一个成熟的开源代码库。
这不是一个刚写出来、到处都是低垂果实的项目。它已经持续维护超过 8 年,被大量真实设备和软件使用,性能优化本身就是这个项目过去多年最重要的工作之一。
当时几个最强模型反复尝试之后,最终大概只能做到和优秀的人类开发者打平,或者略微超过。
但这几天,我用 Opus 5.5 又重新做了一遍。
变化已经非常明显。
它不是找到一个简单的优化点,而是连续进行了多轮 profiling、分析、实现、benchmark,再根据结果继续寻找下一个瓶颈。
最终,在我的测试集上,相比原始实现:
吞吐最高可以接近翻倍;
CPU 计算量平均下降约 30%;
能耗平均下降约 30%;
内存占用平均下降约 30%。
而且这些还是平均收益,一些特定场景下的提升更大。
真正让我觉得有意思的,不只是「AI 又把代码写快了一点」。
而是它正在进入一个过去非常依赖少数专家经验的领域:
面对一个已经被人类优化了八年的成熟代码库,它仍然可以自己找到新的性能空间,提出假设,实现优化,用 benchmark 验证,再继续迭代。
一两个月前,我还觉得 AI Agent 在这种任务上大概刚刚追上最好的工程师。
现在我开始怀疑,我们可能已经越过那个交叉点了。
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接