我们都做过的这个测试,竟暴露了AI的最大弱点
撰文、编程、解题……AI正在越来越多领域媲美人类。然而,一项发表于《美国科学院院刊》子刊的新研究却向我们发出提醒:AI可能在人类习以为常的一项日常能力上意外“翻车”——面对干扰时,持续保持专注。 研究人员借用一个在认知科学中沿用数十年的经典实验范式——Stroop任务(颜色-词汇干扰测试),对GPT-4o、Claude 3.5 Sonnet、GPT-5等当前最先进的大语言模型进行了系统评估。 结果显示:当任务较短时,这些模型尚能准确识别颜色;而一旦任务序列拉长,它们的表现便急剧恶化,部分模型的准确率从90%以上骤降至几乎完全失效,仿佛机器也会“走神”。 01什么是Stroop任务? Stroop任务是一项经典的心理学测试,数十年来一直被用于研究注意力、专注力和自控能力。 在测试中,会展示用彩色墨水印刷的颜色名词,例如“红”“蓝”“绿”,分为两种情况:一是词义与墨水颜色一致,例如用红色墨水印刷“红”字;二是词义与墨水颜色冲突,例如用蓝色墨水印刷“红”字。受试者被要求说出文字的墨水颜色,而非读出文字本身。 这项任务看似简单,但它制造了一个挑战,因为对大多数人来说,阅读文字是一种自动化的习惯。大脑必须主动抑制阅读文字的冲动,转而专注于识别墨水颜色。 心理学家常借助这项实验来测量所谓的“执行控制”能力,即一套帮助人们调节注意力、抵抗干扰、并保持目标专注的心理过程。 02AI的注意力专项测试 研究团队希望探明,当前大型语言模型处理这类认知冲突的方式,是否与人类一致。 ChatGPT、Claude和Gemini等工具背后的核心均为大型语言模型。这类AI通过海量文本训练,习得语言规律,输出的回答往往极具人类语感。 测试时,在仅包含5个颜色词汇的短列表中,即便词义和墨水色彩不匹配,各类AI整体表现良好。 然而,一旦词汇列表加长,AI表现出现断崖式下滑:GPT-4o在处理5个词汇时准确率达91%;而词汇增至10个,准确率跌至57%;当列表扩充至40个词汇后,准确率仅剩15%。Claude 3.5 Sonnet在20个词以内的列表中表现稳定,超过20个词后正确率骤降,处理40个词长列表时,准确率跌至24%。’ GPT-4o和Claude 3.5 Sonnet的表现(准确性)研究人员在GPT-5、Claude Opus 4.1、Gemini 2.5等模型中均观测到相同的衰减规律。 03AI为何注意力失守? 当匹配和不匹配的颜色词同时出现在同一个列表中时,任务难度进一步提升。在这种情况下,AI模型的表现持续恶化,在某些情况下,不匹配色词的识别准确率几乎降至0。 研究人员分析,AI难以牢牢记住“识别墨水颜色”这条核心指令,反而会越来越本能地直接读取文字本身。换句话说,这些系统似乎无法持续抑制它们被训练得最多的那种反应(即读取文字)。 这一发现特别有趣,因为人类也面临类似的冲突。我们通常更擅长读出文字,而非说出墨水颜色。不过,尽管存在这种偏向,在面对一长串词义、色彩矛盾的文本时,绝大多数人仍能保持高准确率,且表现稳定。 图源:包图网 04人类注意力vs机器注意力 该研究凸显了人类智能与人工智能的一个重要区别。 当下,AI系统虽然拥有亮眼的语言生成与逻辑推理能力,但其底层运行机制与生物大脑的注意力调控逻辑截然不同。 人类通常能够在过滤冲突干扰信息的同时,持续专注于特定目标。但研究结果表明,当任务强度持续提升时,当前的AI模型很难实现这种认知自控。 研究团队表示,这些实验中出现的性能崩盘,暴露了当前大型语言模型的底层局限。AI虽能在部分场景模仿人类行为,但其维持注意力的逻辑,和人类存在本质区别。 该研究提醒我们:即便是当前最前沿的AI系统,依旧存在明显短板,特别是当任务需要长时间抵御干扰、持续处理长串信息时,AI的注意力缺陷会暴露无遗。



内容来自:上海市科学技术协会