發生了什麼
最近,一項來自Decoder的研究結果給AI圈潑了一盆冷水。這項研究直接挑戰了OpenAI和Anthropic這兩大巨頭關於“AI能夠進行自主科學研究”的宏大敘事。研究團隊並沒有停留在理論層面,而是直接上手實測。他們選用了目前備受矚目的Claude Opus 4.8和GPT-5.6 Sol作爲AI代理,並給了這兩個模型整整六天的時間,以及高達3000美元的API信用額度,讓它們自由支配去完成科研任務。結果令人咋舌:這兩款被寄予厚望的模型,在沒有任何人工幹預的情況下,並沒有展現出廠商們宣傳的那種“全自動科研”能力。
核心變化解讀
這次測試的核心在於“自主性”與“現實落地”的巨大鴻溝。OpenAI和Anthropic此前一直在暗示,甚至明示他們的最新模型已經具備了像人類科學家一樣,從提出假設、設計實驗到分析數據、得出結論的閉環能力。然而,這項研究無情地揭示了一個事實:雖然Claude Opus 4.8和GPT-5.6 Sol在處理具體指令、生成代碼或文本片段上表現出色,但一旦涉及到長周期的、需要自我糾錯和復雜決策的科研流程,它們就顯得力不從心。
在六天的測試中,擁有3000美元“巨資”的AI代理們並沒有像預想中那樣高效地調用資源,反而常常陷入邏輯死循環,或者在沒有明確方向的情況下浪費API額度。這說明,當前的所謂“自主AI”更多是一種輔助工具,而非獨立的執行者。廠商的宣傳往往基於理想化的短時演示,而真實的科研工作充滿了不確定性,這種不確定性目前仍是AI難以獨自跨越的門檻。這也意味着,距離真正的“AI科學家”取代人類,還有相當長的路要走。
對國內用戶的影響
對於國內的AI愛好者和從業者來說,這項研究無疑是一個重要的“去魅”過程。很多時候,我們被國外大廠炫酷的演示影片所吸引,誤以爲只要訂閱了最貴的Plus或Pro方案,就能讓AI幫我們完成所有工作。這種誤解可能導致不切實際的期望,甚至在購買服務後產生巨大的心理落差。特別是對於那些希望通過GPT-5.6或Claude Opus來自動化完成復雜學術研究或代碼開發的用戶,更需要清醒地認識到:這些工具是強大的助手,但絕不是“甩手掌櫃”。它們能極大地提升效率,比如快速查閱文獻、生成實驗代碼片段,但核心的思路把控和關鍵決策,依然離不開人類專家的介入。盲目依賴AI的“自主性”可能會導致項目延期或方向跑偏,理性看待模型能力,才能更好地利用它們爲我們的工作賦能。
你需要做什麼
面對這樣的技術現狀,我們既不能因噎廢食,也不能盲目迷信。建議大家將AI視爲提升效率的“超級副駕駛”,而不是全自動的“代駕”。在使用這些高級模型時,保持人機協作的模式,由你來把控方向,讓AI去處理繁瑣的執行細節。如果你還沒有體驗過這些頂尖模型的強大輔助能力,或者擔心官方訂閱門檻太高,可以通過ChatGPT 儲值中心輕松獲取API額度或賬號服務。低成本試錯,找到最適合自己的人機協作流,才是當下AI時代的正確打開方式。