Manifest AI联创Jacob谈Transformer的不足与提出 Power Retention

这段 Eye on AI的访谈视频深度探讨了为什么 Transformer 架构无法承载 AI 的未来,并详细介绍了一种名为 Power Retention(幂次保留机制) 的全新架构解决方案 。 受访者是 Jacob(Manifest AI 的联合创始人,卡内基梅隆大学计算机学士、Mila 实验室 AI 博士)。 以下是视频内容的超详细拆解(包含时间戳索引): 一、 当前 Transformer 架构的核心瓶颈:长文本的二次方成本 参数扩展与输入扩展的脱节 [05:18]: 参数扩展(Parameter Scaling) 的成本随参数量呈线性增长,这非常健康,也是推动大模型走到今天的关键。 输入扩展(Input Scaling,即上下文窗口 Context Window) 则是 Transformer 的噩梦。由于每个 Token 都必须与其他所有 Token 计算相关性,其计算和训练成本呈二次方(Quadratic)增长。 “长文本”的行业欺骗与潜规则 [31:20]: 因为真正的 Transformer 训练长文本极其昂贵,市面上宣称支持...

Original Source

Read the full article at Dev →

KhanList aggregates and links to publicly available news content. We do not host full articles from third-party sources. Always verify important information with original sources.