Sander Dieleman 将连续扩散语言模型带上 Hacker News,但 Token 仍是行业标准
- Aisha Washington

- 20小时前
- 讀畢需時 13 分鐘
8 月 24 日,Sander Dieleman 将连续扩散语言模型带到 Hacker News 社区,引发了 42 个点赞和九条评论,围绕这一对 token 生成机制的不同寻常挑战展开讨论。这一论述并非宣布某个已经完成的模型,也不是在宣告基准测试胜利。它提出的问题是:语言模型是否必须始终从左到右生成离散 token?
这一差异至关重要。连续扩散语言模型,即 CDLM,通过模型逐步细化的连续状态来表征语言。相比之下,传统自回归系统会逐个选择 token,使每一个先前选择都成为下一次预测的一部分。
因此,核心竞争并非一个模型对抗另一个模型,而是迭代式全局细化与下一个 token 预测之间的竞争;后者是从 GPT 风格模型到多数开放权重助手所采用的机制。CDLM 提供了不同的计算形态,但其实际价值仍取决于速度、可控性,以及在精心挑选的演示之外的文本质量。
Hacker News 帖子实际带来了什么变化
这篇帖子为一个分散的研究方向提供了清晰的技术叙事,但尚不足以证明自回归语言模型应被取代。
Dieleman 的 CDLM 文章是对一个新兴模型家族的解读。因此,它不同于公司发布、新商业服务上线或经过审计的基准测试结果。它的直接贡献在于梳理概念。
传统语言模型首先将文本拆分为 token。给定一个序列,它会估计下一个 token 的概率分布,选择或采样一个结果,将其附加到序列中,并重复这一过程直至完成。
这种设计已经产出了流畅的文章、实用的代码和交互式助手。但它也形成了严格的依赖链:模型必须先生成前 99 个 token,才能最终确定第 100 个 token。
扩散模型则从另一前提出发。它们在训练期间向数据加入噪声,然后学习逆转这一过程。在生成期间,模型从带噪状态出发,通过反复去噪形成有结构的结果。
图像生成器让这一过程变得耳熟能详。一整张图像可以经过多轮细化逐步成形,因为像素和潜在图像特征位于连续的数值空间中。语言带来了更棘手的问题,因为词语和 token 是离散符号。
早期语言扩散研究通常通过扰动 token、掩码 token,或定义离散类别之间的转换来处理这种不匹配。CDLM 则使用与语言相关联的连续表征。模型可以共同更新这些表征,之后再将其解码为文本。
这一差异构成了文章真正的张力。连续状态提供了梯度、插值和协同更新;但读者最终需要的仍是精确的离散词语、标点符号或代码符号序列。
这次出现在 Hacker News 上之所以重要,是因为它将这一技术权衡带出了专业论文圈。它邀请开发者重新审视:从左到右生成究竟是语言模型的永久特征,还是仅仅是首个成功实现规模化的方法。
有限的讨论数据也设定了恰当边界。42 个点赞和九条评论表明的是聚焦的技术兴趣,而非广泛采用或科学共识。这篇帖子是开发者好奇心的有用信号,却不是 CDLM 已超越现有系统的证据。
为什么连续扩散语言模型此刻值得关注
CDLM 之所以重要,是因为推理结构已变得与模型规模同样关键,尤其是在每个生成 token 都会增加延迟的情况下。
自回归生成存在无法避免的串行成分。服务提供商可以加速矩阵运算、缓存早先计算、推测未来 token,并同时处理大量请求。这些方法能够提升吞吐量,但输出序列仍然要经历一连串相互依赖的决策。
当用户请求长篇报告、大型代码补丁或多个备选答案时,这会变得成本高昂。用户看着文本逐步出现的同时,模型可能正在评估数千个 token。更快的硬件有所帮助,但无法消除这种依赖关系本身。
扩散模型提供了不同的调度方式。模型可以预留一块输出区域,并在每一步去噪中修订多个位置。原则上,这允许在整个序列范围内进行更多并行计算。
“原则上”这一表述至关重要。单次去噪步骤内的并行工作并不保证端到端延迟更低。扩散模型可能需要多次细化,而每一轮都会消耗计算资源。
相关比较并不是将一次扩散步骤与一个自回归 token 相比,而是比较生成可接受答案的完整成本。这包括模型评估次数、序列长度、内存传输、解码开销以及任何纠正步骤。
研究多年来一直在向这一问题推进。最初的 Diffusion-LM 论文探索了在词嵌入上进行连续扩散,并强调可控文本生成。其结果开辟了一条研究路径,但并未使扩散成为语言模型的默认架构。
其他工作则转向离散形式。 SEDD 论文提出的 score-entropy 离散扩散,为离散数据上的扩散开发了一种训练目标。之后,掩码扩散语言模型在追求更强似然和生成质量的同时,简化了这一框架的部分环节。
这些方法并不意味着同一件事。有些对连续嵌入进行扩散,另一些则对离散 token 进行掩码或扰动。有些面向条件控制,有些则寻求通用语言建模。
Dieleman 的框架之所以及时,是因为这些分支正越来越多地给出值得与自回归基线比较的结果。研究问题已经从扩散能否生成文本,转变为其计算结构能在哪些场景提供站得住脚的优势。
这种压力同时落在两大阵营身上。扩散研究者必须证明协同细化带来的收益足以抵消反复迭代的成本。自回归模型构建者则必须继续降低延迟,同时不改变基本的下一个 token 循环。
最终,这是一场围绕推理架构的竞争。模型质量依然重要,但调度、并行性、缓存行为,以及每次前向传播所完成的有效工作量同样重要。
连续扩散与下一个 Token 预测
CDLM 最有力的论点并非去噪听起来更优雅,而是全局修订或许能更好地处理那些让顺序式承诺变得棘手的依赖关系。
设想一段文字,其最后一句改变了开头第一行应使用的正确术语。自回归模型可以在内部进行规划,但其可见输出仍然是从左到右逐步确定的。一个 token 一旦被流式输出,想要改变它就需要单独的编辑操作。
扩散模型可以将草稿视为暂定版本。开头位置、中间从句和结尾都能在多轮细化中发生变化。这提供了一种实现全局一致性的机制,而不仅仅是一种风格差异。
代码提供了更鲜明的例子。函数签名会约束后续语句,而实现过程可能揭示原始签名有误。并行修订可以让模型在呈现最终程序前协调这些位置。
结构化文档也存在类似依赖。标题会影响后续章节,摘要应与支撑证据保持一致,定义过的术语也应前后一致。细化过程可以同时更新多个相互关联的区域。
这正是连续扩散语言模型的承诺,无需将其写成教程也能解释清楚。其吸引力在于将生成视为联合约束满足,而非一条不可逆的局部承诺链。
不过,自回归系统并不像这种描述暗示的那样僵化。它们可以生成隐藏推理、在写作前列出答案大纲、调用编辑工具,或额外运行验证步骤。应用程序也可以在向用户展示前先请求完整草稿。
这些技术将修订移出核心解码规则之外。它们可能复现扩散的部分优势,同时保留成熟的训练基础设施和高效的键值缓存。
两条路线优化的概率分解方式也不同。自回归模型直接将序列表征为下一个 token 条件概率的乘积。这种分解支持直接的似然评估和可控采样。
扩散则学习沿着一个调度过程逆转扰动。其输出质量取决于噪声过程、训练目标、采样器、步骤数,以及将连续状态映射回符号所采用的方法。
对于 CDLM 而言,最终映射尤其重要。连续向量可能介于多个合理 token 之间。然而,自然语言不允许一句话包含 40% 的一个词和 60% 的另一个词。
模型最终必须做出选择。如果过早解码,它可能失去连续细化的价值;如果过晚解码,过程则可能耗费大量计算资源来打磨最终仍会映射到不稳定 token 的表征。
这一边界也会影响代码和精确检索。语义接近的标识符仍然可能是错误的。一个数字发生变化就可能使日期失效,一个符号放错位置就可能令程序无法运行。
下一个 token 预测对这些情况的处理并不完美,但其输出接口与所生成的离散对象相匹配。CDLM 必须证明,离散化前的收益足以超过这一边界引入的不确定性。
并行生成的前景存在计算难题
只有当更少的串行依赖能够抵消反复进行全序列细化的成本时,同时生成多个位置才有意义。
并行性是最可能吸引基础设施团队关注的核心优势。现代加速器在接收大而规整的工作块时表现最佳。逐 token 解码通常会限制单个请求内部的并行执行空间。
扩散模型可以在一次去噪过程中处理整个候选序列。如果它能在较少轮次内完成生成,就可能缩短从提示到答案之间的串行路径。
但每一轮都可能重新处理每个输出位置。传统模型通常在复用先前 token 的缓存表征的同时,仅添加一个位置。扩散模型则可能反复重新计算或修订规模大得多的状态。
这使基准测试设计变得决定性。研究者需要报告实际时钟延迟、总浮点运算量、加速器利用率、内存消耗,以及在相同计算预算下的质量。仅凭每秒 token 数,无法清晰衡量迭代细化过程。
批量大小同样重要。一种在满载加速器上表现良好的方法,未必能为单个交互用户提供相同的响应时间。反过来,一种高延迟方法若其吞吐量能够高效扩展,仍可能适用于离线工作负载。
去噪步数带来了另一个变量。更多步数可以提升质量,但也会增加成本。大幅减少步数能够加快推理,但也会改变误差模式。
这种权衡类似于图像扩散的发展历程。早期系统需要大量采样步数。后来的采样器和蒸馏技术降低了这一数量,使产品响应更快。
文本对精确性的要求更为严格。略有不同的图像仍可能可以接受,而略有不同的法律条款、API 名称或计算结果则可能彻底改变含义。
长度选择同样需要可信的解决方案。自回归模型在输出结束标记时会自然停止。扩散系统则通常从一个区域或表示开始,其最终长度必须被明确管理。
可变长度生成并非不可能。模型可以预测长度、使用填充状态,或修改被掩码的区域。每种方案都会增加影响效率的训练和解码决策。
流式输出带来了产品层面的劣势。自回归助手可以在词语生成时立即显示,从而降低用户感知到的等待时间。全局细化模型则可能更倾向于在前部位置稳定之前暂不输出文本。
部分流式输出可以只展示稳定的片段,但这需要可靠的稳定性度量。否则,用户会看到词语闪烁,或在阅读时发现前面的句子发生变化。
因此,实际问题比“扩散能否并行生成?”更具体。它可以。问题在于,对于真实硬件上的特定工作负载,它是否能带来更优的质量调整后延迟。
在研究人员发表有力的同条件对比之前,并行生成仍是一种具有商业潜力的机制,而非已获验证的普遍优势。
Hacker News 讨论尚无法证明什么
开发者的兴趣能够指出正确的问题,但只有可复现的评估才能确定 CDLM 在何处优于成熟的自回归系统。
Hacker News 讨论之所以有价值,是因为从业者会迅速检验实现成本、隐含假设和容易混淆的术语。它能够揭示哪些主张需要更清晰的证据。
它并非受控评估。投票衡量的是某一时刻一个社区的关注度。评论数量可能取决于发布时间、标题措辞,以及读者是否获得了足够的技术细节。
第一个缺失的测试是在同等资源下比较质量。CDLM 应与参数规模、训练数据、训练算力和推理预算相当的自回归基线进行对比。缺少这些控制条件,架构比较就会变得模糊。
第二个测试是任务多样性。开放式文本可能掩盖小错误,因为许多输出仍然看似合理。代码、数学推理、事实问答、结构化提取和长上下文综合提供了更严格的约束。
第三个测试是生成长度。简短的基准答案无法证明数千 token 场景下的效率。长文档会暴露连贯性问题、内存成本,以及反复重访整个序列所带来的后果。
第四个测试是可控性。扩散长期以来一直承诺提供灵活的引导能力,因为生成过程会经过可修订的中间状态。研究人员应测试这种控制是否能在不过度增加采样成本的情况下保持可靠。
第五个测试是校准。应用需要知道输出何时存在不确定性。自回归模型会暴露 token 概率,尽管这些数值并非完美的置信度估计。CDLM 需要在连续表示和解码两个层面提供同样有用的信号。
训练稳定性带来了另一项不确定性。语言模型受益于广为理解的交叉熵目标和大量工程实践。扩散引入了噪声调度、时间条件和采样器选择,这些因素可能会与规模产生交互。
这并不意味着这种方法不切实际。它只是提高了有关替代性架构主张所需的证据门槛。
更广泛的掩码扩散研究提供了一个重要对照,因为它在不要求采用相同连续表示策略的情况下解决语言生成问题。如果掩码或离散扩散能够通过更简单的 token 接口获得类似收益,CDLM 就必须证明其额外机制的合理性。
自回归研究同样不会停滞。推测解码允许较小模型提出多个 token,再由较大模型验证。多 token 预测训练模型预判不止一个未来位置。更好的内核和缓存也持续降低服务成本。
这些方法保留了顺序语义,同时缩短了实际的关键路径。对 CDLM 的公平评估必须与这些改进后的系统比较,而不是与几年前的基础解码器比较。
还存在将非自回归生成与即时生成混为一谈的风险。任何反复修订整个序列的模型,仍然会在时间维度上经历顺序步骤。它改变的是这些步骤的数量和形态,而不是彻底消除序列性。
因此,对 Hacker News 讨论最有力的解读应保持审慎。CDLM 展现出一种真实的架构选择,而这种选择值得测量。该讨论并未证明连续扩散已经更快、更便宜或更准确。
如果 CDLM 可行,谁将面临压力
可信的低步数 CDLM 将首先对推理架构施压,而模型提供商将有时间调整其产品和训练栈。
最直接的压力对象,是“高质量语言生成必须呈现为逐 token 循环”这一假设。该假设塑造了整个行业中的加速器利用率、服务软件、用户界面和定价模型。
推理平台围绕键值缓存进行了大量优化。这些缓存保留先前 token 的注意力信息,避免模型在每一步都重新计算整个前缀。它们是高效自回归服务的核心。
CDLM 会使用不同的计算模式。基础设施可能需要优先支持全序列细化、时间步调度和中间状态内存。现有优化不会自动迁移。
应用设计者将面临另一种选择。聊天界面目前将流式文本视为常态。基于扩散的产品可能改为先短暂等待,再呈现一段连贯文本;或在其他部分继续细化时显示稳定的章节。
写作和编程工具可能比普通聊天受益更多。它们本就处理完整文档、接受修改,并且常常在草稿完成前隐藏生成内容。全局细化契合其交互模式。
知识工作提供了另一种相关场景。生成研究简报的系统必须在主张、摘要、引用和结论之间保持一致。如果模型学会协调相距较远的段落,联合修订可能减少矛盾。
用户仍然需要可追溯性。全局一致的答案仍然可能一致地错误。处理技术文档的团队,无论底层生成器为何,仍需要以来源为依据的工作流,例如可搜索的知识库。
自回归模型提供商也拥有重大优势。他们已有成熟的训练流水线、部署系统、指令数据、安全评估和用户反馈闭环。新的解码方法必须克服这些长期积累的工程投入。
在彻底替代出现之前,混合设计可能会先行出现。自回归模型可以制定计划,而扩散模型负责填充或修订各个部分。扩散模型可以先起草候选内容,再由自回归验证器检查精确 token。
这类系统会模糊标题中的竞争关系,但也会验证其底层洞见。语言生成不必在每个阶段都依赖同一种解码调度。
胜者将由工作负载决定。交互式对话看重首 token 延迟和流式输出的流畅性。离线报告生成看重吞吐量和文档级一致性。代码生成看重精确性、测试和修订。
CDLM 不需要主导每个类别才能产生影响。在长篇生成、受约束改写或并行候选生成中取得可测量的优势,就可能支撑一个持久的专业化角色。
因此,压力落在基础设施假设上,而非某一家特定公司。如果连续细化变得具有竞争力,服务栈就必须支持的不只是 token 传送带。
决定 CDLM 能否延续的三个信号
下一阶段需要的是关于采样步数、精确输出任务和独立复现的证据,而不是对扩散潜力的更泛泛主张。
第一个信号是同条件延迟基准。研究人员应在相同硬件上,将 CDLM 与优化后的自回归和掩码扩散基线进行比较。对比应披露模型规模、序列长度、批处理大小、生成步数和质量阈值。
有力的结果应显示更低的实际耗时,同时不将过多成本转移到训练中,也不牺牲精确性。若结果仅限于有利的批处理设置,则会缩小主张的适用范围,而不是否定该方法。
第二个信号是在几乎不容近似的输出上的表现。代码补全、JSON 生成、数学表达式、引文和事实提取能够揭示连续细化在离散化后是否仍然成立。
在这些任务上的成功将增强 CDLM 能够支持生产工作负载的理由。持续的 token 不稳定性则表明,该架构可能更适合创意生成,而非精确任务。
第三个信号是在有意义规模上的独立复现。当不同团队能够训练该方法、复现其效率,并确定哪些组件真正重要时,该方法就会更可信。开放实现和详细的消融实验会让这一过程更容易。
这一信号还能防止读者过度解读一次打磨完善的演示。语言模型结果可能依赖于数据、评估提示、采样设置和隐藏的后处理。复现能够区分架构收益与有利的实验配方。
Hacker News 上出现这一讨论带来的更广泛启示,并不是逐 token 预测已经到了寿命终点,而是该领域如今已有足够多的替代机制,可以质疑一个曾经看似固定的假设。
连续扩散语言模型提供了一种连贯的替代方案:在可修订的连续空间中表示语言,同时细化多个位置,再返回离散文本。这一机制可能改善并行性和全局协调能力。
它也带来了围绕重复计算、长度、精确解码、缓存和流式输出的棘手工程问题。没有任何一个问题会因为扩散在图像上表现良好而自动消失。
因此,读者应关注基准测试,而不是标签。CDLM 能否在少数步数内达到有竞争力的质量?它能否在代码和结构化文本上保持准确?其他团队能否复现结果?
这些答案将决定下一场 Hacker News 讨论是围绕一个引人入胜的研究方向,还是围绕一种正在进入实际部署的架构。在此之前,连续扩散值得作为一项严肃实验受到关注,而不应被宣布为逐 token 模型的继任者。


