发生了什么
最近,一项来自Decoder的研究结果给AI圈泼了一盆冷水。这项研究直接挑战了OpenAI和Anthropic这两大巨头关于“AI能够进行自主科学研究”的宏大叙事。研究团队并没有停留在理论层面,而是直接上手实测。他们选用了目前备受瞩目的Claude Opus 4.8和GPT-5.6 Sol作为AI代理,并给了这两个模型整整六天的时间,以及高达3000美元的API信用额度,让它们自由支配去完成科研任务。结果令人咋舌:这两款被寄予厚望的模型,在没有任何人工干预的情况下,并没有展现出厂商们宣传的那种“全自动科研”能力。
核心变化解读
这次测试的核心在于“自主性”与“现实落地”的巨大鸿沟。OpenAI和Anthropic此前一直在暗示,甚至明示他们的最新模型已经具备了像人类科学家一样,从提出假设、设计实验到分析数据、得出结论的闭环能力。然而,这项研究无情地揭示了一个事实:虽然Claude Opus 4.8和GPT-5.6 Sol在处理具体指令、生成代码或文本片段上表现出色,但一旦涉及到长周期的、需要自我纠错和复杂决策的科研流程,它们就显得力不从心。
在六天的测试中,拥有3000美元“巨资”的AI代理们并没有像预想中那样高效地调用资源,反而常常陷入逻辑死循环,或者在没有明确方向的情况下浪费API额度。这说明,当前的所谓“自主AI”更多是一种辅助工具,而非独立的执行者。厂商的宣传往往基于理想化的短时演示,而真实的科研工作充满了不确定性,这种不确定性目前仍是AI难以独自跨越的门槛。这也意味着,距离真正的“AI科学家”取代人类,还有相当长的路要走。
对国内用户的影响
对于国内的AI爱好者和从业者来说,这项研究无疑是一个重要的“去魅”过程。很多时候,我们被国外大厂炫酷的演示视频所吸引,误以为只要订阅了最贵的Plus或Pro套餐,就能让AI帮我们完成所有工作。这种误解可能导致不切实际的期望,甚至在购买服务后产生巨大的心理落差。特别是对于那些希望通过GPT-5.6或Claude Opus来自动化完成复杂学术研究或代码开发的用户,更需要清醒地认识到:这些工具是强大的助手,但绝不是“甩手掌柜”。它们能极大地提升效率,比如快速查阅文献、生成实验代码片段,但核心的思路把控和关键决策,依然离不开人类专家的介入。盲目依赖AI的“自主性”可能会导致项目延期或方向跑偏,理性看待模型能力,才能更好地利用它们为我们的工作赋能。
你需要做什么
面对这样的技术现状,我们既不能因噎废食,也不能盲目迷信。建议大家将AI视为提升效率的“超级副驾驶”,而不是全自动的“代驾”。在使用这些高级模型时,保持人机协作的模式,由你来把控方向,让AI去处理繁琐的执行细节。如果你还没有体验过这些顶尖模型的强大辅助能力,或者担心官方订阅门槛太高,可以通过ChatGPT 充值中心轻松获取API额度或账号服务。低成本试错,找到最适合自己的人机协作流,才是当下AI时代的正确打开方式。