我们都做过的这个测试,竟暴露了AI的最大弱点
撰文、编程、解题……AI正在越来越多领域媲美人类。然而,一项发表于《美国科学院院刊》子刊的新研究却向我们发出提醒:AI可能在人类习以为常的一项日常能力上意外“翻车”——面对干扰时,持续保持专注。 研究人员借用一个在认知科学中沿用数十年的经典实验范式——Stroop任务(颜色-词汇干扰测试),对GPT-4o、Claude 3.5 Sonnet、GPT-5等当前最先进的大语言模型进行了系统评估。 结果显示:当任务较短时,这些模型尚能准确识别颜色;而一旦任务序列拉长,它们的表现便急剧恶化,部分模型的准确率从90%以上骤降至几乎完全失效,仿佛机器也会“走神”。 01什么是Stroop任务? Stro...