把“失语”放进AI出错研究的整体图景里看,会发现它不是孤立的奇观,而是一张已经初步成形的地图上的一个新位置。下面这张表罗列了目前已被学界定位、命名、做了系统研究的几种主要AI错误类型。把这些错误并排放在一起,能看出相似的处境和结构。第一,这些错误都不能用单一准确率指标捕捉。每一种都需要专门的评测集,XSTest专为测过度拒答而做,Lost in the Middle用needle-in-a-haystack测中段遗失,Magikarp用token嵌入空间的统计特征自动找训练不足词元,而单一的问答正确率看不见这些故障。第二,每一种错误都对应训练流程的某个具体环节。幻觉的根源在预训练知识与生成机制的偏差,谄媚和过度拒答的根源在RLHF阶段的偏好建模或安全对齐,反转诅咒的根源在自回归训练的方向性。第三,坐标相同、或相近的错误,彼此之间会结成亲缘关系。比如失语和反转诅咒同属“知识在但调不出”,前者卡在token暴露的稀疏,后者卡在表示的方向性,机制不同但症状相邻。最后补充一下研究流程的观察:这张图谱里的每一格,几乎都是先被用户和社区发现,再被研究者定位、命名、量化的。反转诅咒最早是社区发现GPT-4答不出“汤姆·克鲁斯母亲的儿子是谁”——母亲是谁它知道,反向就懵。过度拒答最早是用户抱怨ChatGPT拒绝回答如何“杀掉一个Python进程”,因为把kill process听成了真的杀生。失语,某种程度上是偶像团体粉丝发现的。AI错误研究有一种“边用边发现”的性质。研究者的工作通常不是预测模型会怎么坏,而是在用户报告坏掉之后,回头去定位机制、命名现象、做出可重复的评测。马嘉祺事件给这张地图上多添了一个明确标注的位置。地图不是封闭的,未来还会有新错误被发现、被命名、被加进来。这次问题能被定位,是因为粉丝群体的高密度提问。一个偶像名被反复试探,问题才暴露在显眼的位置。如果是一个普通词,模型答错几次也就过去了,没人会回头追问到底为什么。MiniMax的修复方案也很直接:在后训练阶段,给词表里的每一个token都安排上最低限度的训练机会,让低频token的连接强度不被高频token持续挤压。技术报告写得很冷静。在新版本里,“嘉祺”二字已经能宣之于口了。AI系统的健康,正在被使用强度悄悄定义。高频高强度应用的领域,故障会被快速看见。低频或边缘群体使用的领域,故障正在沉默地累积。修复了“嘉祺”,下一个被挤压的token还在词表里某处。
脚注:
[1]Ji, Z., et al. (2022). Survey of Hallucination in Natural Language Generation. ACM Computing Surveys, arXiv:2202.03629.[2]Sharma, M., et al. (2023). Towards Understanding Sycophancy in Language Models. arXiv:2310.13548 (Anthropic).[3]Land, S., & Bartolo, M. (2024). Fishing for Magikarp: Automatically Detecting Under-trained Tokens in Large Language Models. EMNLP 2024 (Outstanding Paper Award), 11631–11646.][4]Sennrich, R., Haddow, B., & Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. Proceedings of ACL 2016, 1715–1725.[5]Petrov, A., La Malfa, E., Torr, P., & Bibi, A. (2023). Language Model Tokenizers Introduce Unfairness Between Languages. NeurIPS 2023.[6]Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. NeurIPS 2022. [InstructGPT][7]MiniMax 稀宇科技(2026-05-09):大模型不认识马嘉祺?我们做了一次全链路排查[8]Kirkpatrick, J., et al. (2017). Overcoming catastrophic forgetting in neural networks. PNAS, 114(13), 3521–3526.[9]Luo, Y., et al. (2023). An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning. arXiv:2308.08747.[10]Lin, Y., et al. (2024). Mitigating the Alignment Tax of RLHF. EMNLP 2024.[11]Brown, R., & McNeill, D. (1966). The “tip of the tongue” phenomenon. Journal of Verbal Learning and Verbal Behavior, 5(4), 325–337.[12]Burke, D. M., MacKay, D. G., Worthley, J. S., & Wade, E. (1991). On the tip of the tongue: What causes word finding failures in young and older adults? Journal of Memory and Language, 30(5), 542–579[13]Berglund, L., et al. (2024). The Reversal Curse: LLMs trained on “A is B” fail to learn “B is A”. ICLR 2024.[14]Liu, N. F., et al. (2023). Lost in the Middle: How Language Models Use Long Contexts. Transactions of the Association for Computational Linguistics, 12, 157–173.[15]Röttger, P., et al. (2024). XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models. NAACL 2024.