从LLM视角重新思考熵的定义

香农(Claude Shannon)在 1940 年代创立了“信息论”,而现代大语言模型(LLM)天天在用的核心损失函数——交叉熵(Cross Entropy),其实就是从这里演变来的。 这个系列的核心观点是:预测和压缩在数学上是完全等价的,甚至可以说“压缩就是智能”。 我们可以把视频拆成 4 个好玩的步骤来理解: 1. 经典思维实验:外星机器人的省钱密码 想象我们送了一个机器人去月球,我们要从地球给它发“上、下、左、右” 4 种指令。因为太空通信按比特(bits,即 0 和 1)收费,非常贵,所以我们想让发送的 0 和 1 尽可能少。 但是,这 4 种指令出现的概率不一样: 上:50% 的时间都在往上走 下:25% 的时间往下走 左:12.5% 右:12.5% 如果是老实人设计编码,可能会想:4 个方向,那就用固定 2 位比特呗(比如 上=00, 下=01, 左=10, 右=11)。这样平均下来,每个指令死板地消耗 2 个比特。 但聪明人会想:既然“上”出现得最频繁,那给它分配最短的编码! 上 = 0 (只占 1 位) 下...

Original Source

Read the full article at Dev →

KhanList aggregates and links to publicly available news content. We do not host full articles from third-party sources. Always verify important information with original sources.