发生了什么
最近,AI圈有个大动静。Moonshot AI搞出了一个叫做PerceptionBench的新test。这玩意儿专门用来给多模态AImodel的“眼睛”打分,看看它们的视觉感知能力到底行不行。result呢?根据decoder的消息,testresult出来后,情况不太乐观,现在的AImodel在视觉感知这块儿,表现can说相当拉胯,并没有大家想象中那么神。
核心变化解读
这次PerceptionBenchtest的推出,其实是在给狂奔的AI大model泼了一盆冷水。以前大家都觉得,现在的AI能看图说话、能生成视频,视觉能力肯定已经炉火纯青了。但Moonshot AI这个test就像是一面照妖镜,专门用来检查model是不是真的“看懂”了图像,而不是在瞎蒙。
test的核心在于评估“视觉感知”,这比simple的识别物体要难得多。它涉及到理解图像的深度、细节、光影关系甚至是逻辑上的合理性。testresult显示,即便是那些号称多模态能力顶尖的model,在面对复杂的视觉任务时,也经常会出现理解偏差,甚至犯一些低级错误。这Notes,目前的AImodel在处理视觉info时,可能更多是依赖概率Stats,而不是真正具备了类似人类的视觉认知。这对于行业来说是个重要的信号:多模态AI的发展还有很长的路要走,现在的技术瓶颈比预想的要难突破。
对users in China的影响
对于我们users in China来说,这个testresult其实挺有参考价值的。现在很多人都在用AI来辅助work,比如做设计、写文案 or 者处理图片。如果你以为现在的AI能完全替代人眼去审核图片 or 者进行精准的视觉创作,那看了这个testresult可能得冷静一下了。
特别是对于那些依赖高级AI功能的users,比如useChatGPT Plus or Proplan的users,虽然这些付费model在视觉能力上确实比free版强,但也不是万能的。我们在useGPT-4o or Claude 3.5 Sonnet等model进行视觉分析时,依然need 保持警惕,最好还是manual复核一遍。这次test提醒我们,不要神话AItools,哪怕是Plus级别的service,在视觉感知上也存在局限性,合理利用tools才是王道。
你need 做什么
既然AI在视觉上还有坑,咱们在use时就得留个心眼。不要完全把“看图”这事儿交给AI,尤其是在关键业务上。想体验更高级的视觉功能, or 者想尝试不同的model效果,你can通过ChatGPT Recharge Center升级yourservice,receive更强的算力supports。但记住,AI只是助手,最后的把关还得靠你自己。