AI自主研究遭质疑:GPT-5.6 and Claude未能通过六daystest

GPT-5.6Claude OpusAI新闻AItoolsrecharge
AI自主研究遭质疑:GPT-5.6 and Claude未能通过六daystest

发生了什么

最近,一项来自Decoder的研究result给AI圈泼了一盆冷水。这项研究直接挑战了OpenAI and Anthropic这两大巨头关于“AI能够进行自主科学研究”的宏大叙事。研究team并没有停留在理论层面,而是直接上手实测。他们选用了目前备受瞩目的Claude Opus 4.8 and GPT-5.6 Sol作为AI代理,并给了这两个model整整六days的时间,以及高达3000USD的API信用额度,让它们自由支配去completed科研任务。result令人咋舌:这两款被寄予厚望的model,在没有任何manual干预的情况下,并没有展现出厂商们宣传的那种“全auto 科研”能力。

核心变化解读

这次test的核心在于“自主性” and “现实落地”的巨大鸿沟。OpenAI and Anthropic此前一直在暗示,甚至明示他们的latestmodel已经具备了像人类科学家一样,从提出假设、设计实验到分析数据、得出结论的闭环能力。然而,这项研究无情地揭示了一个事实:虽然Claude Opus 4.8 and GPT-5.6 Sol在处理具体指令、生成代码 or 文本片段上表现出色,但一旦涉及到长周期的、need 自我纠错 and 复杂决策的科研流程,它们就显得力不从心。

在六days的test中,拥有3000USD“巨资”的AI代理们并没有像预想中那样高效地调用资源,反而常常陷入逻辑死循环, or 者在没有明确方向的情况下浪费API额度。这Notes,Current 的所谓“自主AI”更多是一种辅助tools,而非独立的执行者。厂商的宣传往往基于理想化的短时演示,而真实的科研work充满了不确定性,这种不确定性目前仍是AI难以独自跨越的门槛。这也意味着,距离真正的“AI科学家”取代人类,还有相当长的路要走。

对users in China的影响

对于China的AI爱好者 and 从业者来说,这项研究无疑是一个重要的“去魅”过程。很多时候,我们被国外大厂炫酷的演示视频所吸引,误以为只要subscribe了最贵的Plus or Proplan,就能让AI帮我们completed所有work。这种误解可能导致不切实际的期望,甚至在purchaseservice后产生巨大的心理落差。特别是对于那些希望通过GPT-5.6 or Claude Opus来auto 化completed复杂学术研究 or 代码开发的users,更need 清醒地认识到:这些tools是强大的助手,但绝不是“甩手掌柜”。它们能极大地提升效率,比如fast查阅文献、生成实验代码片段,但核心的思路把控 and 关键决策,依然离不开人类专家的介入。盲目依赖AI的“自主性”可能会导致项目延期 or 方向跑偏,理性看待model能力,才能更好地利用它们为我们的work赋能。

你need 做什么

面对这样的技术现状,我们既不能因噎废食,也不能盲目迷信。建议大家将AI视为提升效率的“超级副驾驶”,而不是全auto 的“代驾”。在use这些高级model时,保持人机协作的模式,由你来把控方向,让AI去处理繁琐的执行细节。如果你还没有体验过这些顶尖model的强大辅助能力, or 者担心officialsubscribe门槛太高,can通过ChatGPT Recharge Center轻松receiveAPI额度 or accountservice。低成本试错,找到最ideal for自己的人机协作流,才是当下AI时代的正确openmethod。

need recharge ChatGPT?
2-minute delivery · Alipay / WeChat Pay · automatic delivery
Recharge Now →

📚 Related

❓ FAQ

研究中use了哪些AImodel进行test?
研究use了Claude Opus 4.8 and GPT-5.6 Sol作为AI代理进行test。
这项研究的主要结论是什么?
研究结论表明,目前的AImodel(如Claude and GPT-5.6)在长周期的自主科研任务中表现不佳,无法在没有人类干预的情况下独立completed复杂的科研流程,这 and 厂商的宣传相悖。