曾经,任何一篇较为深入的文章的作者,在写作时都会遇到简明与易懂的抉择。假如希望自己的文章通俗易懂,那么就需要对引用的概念进行解释,这就导致一篇文章很容易非常冗长,重点得不到凸显,非常考验作者的谋篇布局水平。更重要的是,解释这种概念本身是一种重复性工作,对于外行的读者的确能起一定的辅助作用,但对于内行的读者来说就是冗余,并且对于作者来说也是一种负担。倘若希望自己的文章简明扼要,情况就正好相反,利好作者与内行的读者,但无形中对于外行的读者增加了门槛。

举个例子,在大语言模型的语境中,如果简明的说法是:“在注意力层计算前,需要先对输入向量进行标准化。”那么,易懂的说法就要解释什么是注意力,什么是注意力层,什么是标准化,为什么输入是以向量的形式。如果受众的知识水平更低,那么甚至要解释什么是向量。当然,如果受众的水平要求作者解释什么是向量,那么实际情况中一般干脆不写这句话了。总之,作者必须在简明与易懂之间找到一个平衡,尽可能让大多数自己的目标受众能理解自己的文章。

这个问题的本质在于,就像大语言模型的上下文有限一样,人脑的“上下文”也是有限的。但问题在于,世界在很多时候是相当复杂的,而在认识世界、改造世界的目的之下,我们很多情况下必须要理解极端复杂的事物。这导致人必须进行多级的抽象,将复杂度“折叠”起来,降低认知成本。推广而言,这个问题相当普遍,试举几例:

  • 证明一个几何学的命题,理论上说只用公理就完全可以,但我们创造了定理、推论、引理等等,将常用的结论封装起来,在一个复杂的问题中直接使用;
  • 写代码的过程中,我们已经很少用机器语言、汇编语言书写,至少都在使用 C 语言这样的低级语言。而当前最前沿的大语言模型领域,居于统治地位的是 Python,原因就在于 Python 高级语言的特性封装了很多低级特性,让工程师可以专注逻辑本身;
  • 同样是写代码,如果要写一个大型项目,架构设计都是相当重要的组成部分。每一层都将本层的复杂度封装为接口,暴露给上一层的只有使用方法。这允许每一层只用关注本层的一小部分逻辑,将不同的逻辑模块解耦;
  • 任何一个学科,都会有自己的专有名词,将核心概念封装起来。倘若没有这种专有名词,学术交流都将变得难以进行;
  • 在做饭的过程中,我们更多关注的是如何烹饪,并不关心粮食的种植、运输、售卖。

在过去,人们提出了几种办法缓解这种情况。

  1. 典型代表是维基百科,解决办法是做一个“知识库”,将不同的概念分散在不同的页面中,并提供跳转的超链接。但问题是,这样的效果未必好。原因在于各个页面都是相互独立的,缺乏基础知识的读者,很难真正通过查百科学会一个概念,很难直接理解并运用。
  2. 典型代表是各种教材,解决办法包括两点。首先限定读者的知识水平,例如初二的教材就限定读者刚刚学完初一的课程;其次在设计课程的时候考虑前后相继,在靠前的教材中讲清楚靠后的教材所需要用到的所有概念。这种方法的问题在于,适用面太窄,只对体系完备的宏大项目有用,大多数情况下我们都不会写一本教材。

以上两种方法,有几个共性的问题。第一是重复造轮子,如果大家都运用这个方法,那么不同的文章就要重复解释同一个事物。更重要的问题如本文开头所述。如果解释太细,那么搭建成本高,需要解释的内容太多,即使使用超链接的方式,也只是减轻了读者的负担,并没有减轻作者的负担。如果解释的粒度太粗,那么相当于放弃了很多读者。在尝试平衡二者时,很难兼顾所有情况,让所有读者都得到自己所需要的。也就是说,灵活性太差。

但最近,大语言模型的出现,似乎改变了这种情况。例如,同样是开头的这句关于大语言模型的论述,现在的读者完全可以复制并粘贴到聊天框中,例如:

请帮忙解释一下这段话中的专有名词,用通俗易懂的语言:在注意力层计算前,需要先对输入向量进行标准化。

读者可以自行尝试。在这里粘贴我得到的回答意义不大,因为大语言模型日新月异,新的模型总体来说强于旧的模型。对于读者来说,这相比传统的方法有两个难以比拟的好处:

  1. 个性化。不同的读者可以选择不同的提示词,例如可以要求使用生活化的比喻来解释,或者告诉大语言模型自己对其中某个已经了解,但对另外一些不了解。
  2. 交互性。如果大语言模型解释之后,自己仍然没有完全理解,完全可以追问。

对于作者来说,好处同样很明显,也就是解放了作者的思想,让作者不必考虑通俗性的问题,可以专注文章核心内容本身。进一步说,如果说文字的价值有大小之分,我想当今时代一个很重要的判定标准就是:AI 能否写出来。像专有名词解释这件事,AI 完全能做,且很多情况下做的比人更好。那么,我认为这就应该放心交给 AI。这样,创作者的精力就能更多的放在 AI 写不出来的内容上,而这些内容,往往更有价值。

当然,这个判断当然也不绝对,有些概念需要作者深入讲解,此时完全不解释,让读者自行询问 AI 自然不合适。但事实上,如果 AI 能完成 80% 的工作,那么何不让它完成呢?我们作为人,得以专注剩下 20% 的工作,本身就是一种进步。

我立志写一些 AI 写不出来的内容,并且希望尽可能少地写一些 AI 能写出来、甚至写得比我更好的的内容,于是写了这篇文章,作为一篇观前提示。望读者了解我的态度,谅解我在其他文章中对一些概念不做解释的行为,同时希望我的文章能更加聚焦核心观点,以精炼的语言对读者有所启发。