凯文·凯利最近在文章 Why Are LLMs Smart? 中讨论了一个常见问题:大语言模型到底为什么会显得聪明?
很多人解释大语言模型时,会说它们“只是预测下一个词”。这个说法从技术角度看并没有错,但凯文·凯利认为,这种说法容易让人低估语言本身的复杂性。
语言不是一堆空洞的符号。人类几千年来积累的知识、经验、逻辑、情绪、社会关系、因果判断和世界模型,都被压缩在语言之中。一个模型如果能够在大规模语言材料中学习如何预测下一个词,它实际上也在学习语言背后隐藏的结构。
也就是说,LLM 的“聪明”不是凭空来的。它不是魔法,也不是单纯的数据库检索,而是从人类语言中提取出了大量模式。语言本身就是文明的外壳,而大语言模型正是在这个外壳中训练出来的。
如果训练材料是整个人类文明留下来的语言,那么“预测下一个词”本身就可能包含大量智能。
核心观点:大语言模型不只是“猜词机器”。如果语言承载了人类文明的结构,那么学会预测语言,就等于在某种程度上学会了文明中的模式。
本文根据凯文·凯利近期公开文章整理翻译,便于中文读者阅读。