生成式AI的信息熵问题

标签: 观点 道→理念 AI 信息论 | 发表时间:2026-08-11 19:19 | 作者:钱魏Way
出处:https://www.biaodianfu.com

生成式AI的信息熵问题

信息论里,信息熵衡量的是不确定性的消除程度。一个事件发生的概率越高,它携带的信息量就越少。当前的大语言模型,工作逻辑恰是:在给定上文后,预测下一个最“合理”、出现概率最高的词元。这个机制,天然倾向于选择数据分布中“最大公约数”式的表达。因此:

  • “正确的废话 ”是概率的必然。语料库里,“随着科技的发展”“在当今社会”“我们必须高度重视”这类搭配,统计上出现的频率远高于充满洞见的稀缺表达。模型为了在多数情况下不犯错,会优先输出这些平滑的过渡句,而非信息密度高的新锐观点。
  • 多次同义重复是 “分布外泛化 ”的不足。当模型需要在长篇内容中维持连贯性时,它缺乏一个真正的“全局观点”核心来统筹。于是会不自觉地围绕一个中心论点,用不同的话术做圆周运动,把说过的意思在概率空间里重新排列组合。从信息论看,后续的表述与前文高度冗余,条件熵趋近于零,没有消除新的不确定性。

大语言模型,比如 GPT,本质是一个自回归的条件概率模型。它的根本任务只有一件事:给定上文 “AI 正在……”,在所有可能的下一词元中,计算出每个词接在后面的概率。然后,从这个概率分布里,选一个词吐出来。关键就在于这个“概率分布”的形状。训练数据的统计规律,会把分布塑造成: 高频、常见、安全的词,被赋予极高的概率,像一座座尖峰;罕见、新奇、锋利的表达,被压成一片几乎为零的平原。模型要“不犯错”,最稳妥的办法,就是 永远待在那座最高峰的山腰上。这个选择行为,就是“平滑”。它把语言的各种可能性,揉碎、压扁,最后输出一个最不会出错的“平均脸”。所以,“平滑”不是随机的,而是统计学上的必然——每一次输出,都是一次对数据中“最大公约数”的采样。

心理学家做过一个实验:把几百张人脸照片叠加起来,合成一张“平均脸”。结果发现,这张脸非常和谐、端正,毫无瑕疵,但也毫无特征,看过即忘。大语言模型,就是一张语言的“平均脸”。它的训练数据里有无数张“语言的脸”,经过万亿次叠加,它学会了那个最平滑、最无特色的表情。

而人类那些充满洞见的表达,就是一张充满棱角、能让你驻足凝视的独特面孔。它在概率分布上,是一座罕见的孤峰,模型天然倾向于绕开它。

你可以把训练数据的概率分布想象成一片崎岖的山地。有高耸入云的主峰(高频套话),也有幽深的峡谷和陡峭的孤峰(新奇表达)。大语言模型的生成过程,就像在这片山地上覆盖了一层磨砂玻璃。透过玻璃,你只能看清那些最高的、最平滑的主峰轮廓,而所有尖锐、低概率的细节,都被模糊掉了。最终你看到的,就是模糊后那片平滑的丘陵——“正确的废话”就是这片丘陵上唯一能看清的东西。

优秀的作者像一个好的信源编码器,会极力压缩内容,剔除冗余。AI生成则更像一个平庸的编码器,留下了大量“填充词”和“语义复刻”。

为什么存在信息熵问题,生成式AI还是很有用?

既然我们说AI是概率的平滑器,输出的是低信息熵的“平均脸”,为什么很多人(包括用户自己)仍然觉得AI生成的内容很有用、很有价值?

价值感的相对性

对于不同的人,同样的内容信息量不同。对一个领域新手,AI总结的“废话”可能包含他原本不知道的框架,信息量其实是高的。

信息论里,信息量衡量的是对接收者而言不确定性的消除。一个句子对我是废话,对你却可能是新知。

  • 绝对信息量:对全人类知识总库的增量。AI 很难贡献这个。
  • 相对信息量:对你个人认知盲区的消除。这是 AI 的强项。

当你让 AI 总结一篇论文或解释一个概念时,它用的是高概率的“平滑”语言。但因为你之前对这个领域知之甚少,这些“平滑”的表述,极大地消除了你的不确定性。它没有给人类知识库减熵,但给你的大脑做了大幅度的减熵。 这种“新手友好”的平滑,恰恰是高效学习的管道。

结构价值与压缩价值

AI擅长整合海量信息,把分散的知识点连接成结构化的脉络,这种“组合”本身就是一种价值,即使每个句子单独看熵不高,但整体作为索引或地图有价值。一个清晰的报告大纲、一份分类归纳的总结、一段步步为营的教程。这些框架本身,就是将碎片化的高熵混乱,压缩成了结构化的低熵秩序。在你苦于信息过载、思维混乱时,AI 提供的这个“有序结构”就是一种极高的价值,它帮你节省了最贵的东西——脑力。它不是思想的原创者,却是信息的卓越建筑师。

工具性价值

平滑的表达省去了人们自行组织语言的认知负荷,在需要快速产出标准文稿时,它像“预制件”一样节省时间,价值在于效率。

  • 你需要一封措辞得体的商务邮件,AI 瞬间生成 10 个模板,你只需选择修改。
  • 你需要一段代码实现常规功能,AI 直接写好,你只需审查测试。

它的价值不在于写得多深刻,而在于把“从0到1”的痛苦生产,变成了“从1到1.2”的轻松优化。它消灭了“面对空白页的恐惧”,释放了你的心智去做更高阶的决策和创意。

启发式价值

平滑内容可作为“思维的脚手架”,尽管本身没有洞见,但提供了一个可批判、可修改的基础,激发人的进一步思考。这或许是最高级的用法。你把 AI 的输出当作一根探针,刺入问题空间,不是为了接受答案,而是为了观察反弹。

你问:这个方案的三个优势是什么?AI 答:第一,成本低;第二,效率高;第三,风险可控。(完全正确的废话)此时,你的价值开始显现。你会立刻反驳:“不对,‘风险可控’在 X 场景下根本不成立,因为……” —— 这个反驳,正是你独创性洞见的起点。AI 平滑的回答,像一面白墙,完美地映照出你思想的轮廓。 它用平庸,激发出了你的不平庸。在这里,它的价值不是内容,而是作为思想催化剂和磨刀石。

如何正确的看待信息熵问题

这是技术路线的内生特质,无法根除。只要模型基于“最大似然估计”生成内容,它给出的就是统计中心,而非认知前沿。它模仿的是语言的形式,而非思想的过程。因此,AI在“知识平权”(快速提取已知信息)上是利器,但在创造高信息密度的原创洞见上,有天然短板。把它放在正确的通信模型里,价值才会显现。AI输出的低熵内容,不应被视为“成品”,而应被视为一个尚待压缩的中间态信源。它的最佳定位不是终端,而是人机协作的起点。高信息密度的产出,需要人类来注入“惊讶度”:

  • 人作为“压缩器”:你用它生成初稿,然后进行残酷的删减、提炼、交叉印证,把10句车轱辘话压成1句判断。
  • 人作为“扰动源”:不断用反常识、跨领域的提示词去扰动模型,把它逼出概率的舒适区,强制输出低概率但高价值的连接。

过度依赖AI会系统性地催生平庸

个体思维的“熵寂”

过度依赖指的不是“用AI辅助”,而是让AI替代了认知中产生负熵的核心环节。

  • 思考变成选择:当你让AI生成三个方案然后做选择,你其实是在一个高概率的池子里挑一个顺眼的,跳过了那个产生“惊讶”的认知冲突过程。
  • 心智模型“返祖”:学习任何复杂领域,本质是在脑中构建一个对外部世界的压缩模型。这个压缩过程极其耗能,但正是它让你获得洞察。一旦每次都用AI直接要结论,你的脑内世界模型会变得扁平、充满标签,因为你自己没有去跑那趟压缩——你脑中留下的,只有AI吐出的低熵信息残渣。

反馈循环里的 “模型自噬

这不仅是个人问题,更是一个结构性的恶性循环。

  • 训练数据的污染:网络上的内容正在被AI生成的低熵文本大量填充。未来的大模型,将不可避免地用这些“AI生产的高概率文本”进行训练。这会造成一种“模型自噬效应”——模型学习的是自己前辈平滑过的概率分布,循环往复,分布越来越窄,语言失去多样性和边缘可能性,创见被系统性地稀释。
  • 评价标准的坍缩:当大量“足够好”的AI平庸内容淹没了互联网,一篇信息熵高、需要用心读的文章,在信息流中竞争不过10篇AI生成的“信息摘要”。久而久之,“可用”驱逐“优秀”,我们整个文化的信噪比会极速下降。

破局点:把AI当作“认知杠铃”

平庸不是过度依赖AI的必然结果,关键在于把依赖放在哪个环节。

  • 用AI做极限的信息杠杆(工具化)。让它去处理那些本就是高概率重复的工作。这是把低熵事务外包,为你腾出认知带宽。
  • 在核心思考上刻意对抗AI的概率(主体化)。
    • 先自己写“丑陋”的初稿,产生你自己的认知框架。这个“丑陋”里包含着你的错误和直觉,那是高熵的矿。之后再用AI来挑刺、反诘、填充资料,而不是让它替你写。
    • 作为“扰动源”去审问AI。不要满足于它给出的平滑结论。追问:“你这个观点的反例是什么?”“用完全相反的理论框架,会怎么解释这件事?”“把你刚才说的那三点,压缩成一句有锋利感、可能会冒犯人的话。”——这就是在向模型注入“惊讶”,逼它产出低概率、高信息量的连接。
    • 像编辑一样冷酷地压缩。拿到AI产出后,把“人作为压缩器”这个角色做到极致:删掉所有顺滑的过渡,砍掉所有同义反复,只留下骨骼般的逻辑,再用你自己的见解往里面填入血肉。这个过程,就是你作为认知主体重新注入负熵的过程。

避免平庸的唯一路径,是牢牢守住认知的主体性:始终是你,在定义问题、在制造扰动、在执行最终的压缩与判断。AI应该是帮你撬动世界的杠杆,而不是替你思考的大脑。

相关文章:
  1. 自然语言处理之GPT

相关 [ai 信息熵 问题] 推荐:

生成式AI的信息熵问题

- - 标点符
信息论里,信息熵衡量的是不确定性的消除程度. 一个事件发生的概率越高,它携带的信息量就越少. 当前的大语言模型,工作逻辑恰是:在给定上文后,预测下一个最“合理”、出现概率最高的词元. 这个机制,天然倾向于选择数据分布中“最大公约数”式的表达. “正确的废话 ”是概率的必然. 语料库里,“随着科技的发展”“在当今社会”“我们必须高度重视”这类搭配,统计上出现的频率远高于充满洞见的稀缺表达.

截止2025年终AI现在最大的问题是什么?

- -
花了两天时间,把AI圈大佬们的2025年终总结全翻了一遍. 写了篇万字长文, @sama. 发了两篇博客, @geoffreyhinton. 上了CNN, @ylecun. 在X上吵了一架,Ilya Sutskever离开OpenAI后第一次深度受访. 看完之后发现一件很有意思的事:. 所有人都在回答同一个问题——AI现在最大的问题是什么.

[译] 关于 AI,你最该了解但从没想过的四个问题

- - IT瘾-dev
来自雷锋网(leiphone-sz)的报道. 雷锋网按:人工智能在当今社会被讨论的如此火热,但是仔细一想,你可能甚至并不知道它的基本运行逻辑. 人工智能和机器学习是一回事吗. 人工智能是不是能解决所有的问题. 如果不是的话,人工智能到底能解决哪些问题. 对人工智能来说,哪些事情是真正困难的. 人工智能给社会到底带来了哪些挑战.

数据压缩与信息熵

- - 阮一峰的网络日志
1992年,美国佐治亚州的WEB Technology公司,宣布做出了重大的技术突破. 该公司的DataFiles/16软件,号称可以将任意大于64KB的文件,压缩为原始大小的16分之一. 业界议论纷纷,如果消息属实,无异于压缩技术的革命. 许多专家还没有看到软件,就断言这是不可能的. 因为根据压缩原理,你不可能将 任意文件压缩到16分之一.

AI vs AI--当AI与自己聊天

- Tim - Solidot
Shawn the R0ck 写道 "最烦人的事情之一莫过于被强迫与一个白痴对话. 但当你发现你最讨厌与之交谈的白痴其实就是你自己的基于人工智能程序的拷贝...康奈尔创造性机器实验室决定看看当AI尝试跟自己交谈会发生什么. 他们的健谈的AI程序Cleverbot与自己进行文本交互,之后朗读出文本并且显示到视频中.

在世界人工智能大会上,看到中国 AI 行业将持续面对的三个重要问题

- - 极客公园
当马云和马斯克坐到一起聊天时,你才会发现,这两位在世界范围内,富有影响力的商业领袖,实际有着对比明显的差异性. 在上海世博中心举办的世界人工智能大会(WAIC)上,马云和马斯克作为开幕式的压轴嘉宾,开始一段半个多小时的对谈. 有趣的是,话题虽然围绕着 AI,但两人都不算对 AI 技术有多少研究,马云自不必说,马斯克的形象更多的是一位富有商业天才的工程师,而两人的共同点是,都是极具创造性和想象力的理念提出者.

AI播客牛逼

- - Yuko's Blog
为了方便自己上下班开车的时候有书可以听,研究了一套全程使用AI来制作拆书播客的方法. 顺便一提就连这篇文章的封面也是纯AI的. 用notebooklm生成音频概览. 谷歌旗下的产品notebooklm具有“生成音频概览”的功能,其实就是生成一段两个主持人根据上传的文档内容进行对谈的播客,点击对应按钮右侧的“>”键还可以进一步输入提示词,对生成内容的长度、语言、内容进行设置.

一家公司的 AI 教育观:AI 管「教」,真人来「育」

- - 极客公园
叮咚课堂 App 上线不过八个月,他们一面竭力在竞争异常激烈的在线少儿英语赛道上保持着刻意的低调,一面又疯狂地收获了平均 300% 月度的用户增长率. 这让他们创始人邱明丰对未来信心更盛了. 在艾瑞咨询发布的《2018 年中国在线幼儿启蒙英语行业白皮书》中提到,近年来人工智能在互联网教育领域大规模展开,但在在线幼儿启蒙英语教育中的应用甚少,随着资本的注入和行业的发展,其有望通过人工智能进一步提升用户在线启蒙英语学习的体验和效率.

AI 不是裁员的原因,巨额 AI 支出才是

- - 奇客Solidot–传递最新科技情报
美国公司在宣布大规模裁员时通常以 AI 为借口,但裁员的原因真的是 AI 吗. 很多研究和数据给出了不同观点:MIT 媒体实验室的研究发现,95% 的生成式 AI 试点商业项目没有成功;Atlassian 的调查显示 96% 的企业没有看到 AI 显著改进了组织效率、创新或工作质量;另一项研究显示四成企业员工在工作中面临“AI 垃圾(AI slop)”问题,需要花大量时间处理该问题.

贪吃蛇AI挑战赛第二季

- 温柔一刀 - 黑客志
如果你对这个活动感兴趣,可以先从这里开始,编写一个AI程序,然后将你的AI程序以及你对平台的改进建议发送到jin.cai20#gmail.com,主办方将会从中选择12名选手参加6月24到25持续一个周末的编程派对,并提供往返交通及住宿费用,下面是活动的详情:. 时间: June 24th – June 26th *.