两张 X 光轮廓生成了一个 3D 股骨,但真正的难题是对应关系
Horizon MachineLearning 上的一则讨论展示了一条 3D 重建流程:仅基于两张 X 光轮廓和 50 个参考股骨网格构建。其作者称,即使在重建过程中未使用神经网络或患者 CT,该方法在部分留出形状上仍达到了毫米级误差。
更重要的结果则并不那么乐观。几种常见的对应关系方法生成的表面,比原始 CT 衍生几何结构粗糙得多。ShapeWorks 是唯一达到作者预设验收阈值的测试方法。
这使讨论重点从神经网络与传统建模之争,转向紧凑的解剖学先验与真实患者几何多样性之间的较量。即使模型能完美优化其系数,只要目标解剖结构落在其已学习形状空间之外,仍可能失败。
这项工作是公开分享的,并非同行评议研究。其数值结果尚未得到独立复现,对真实 X 光片的验证也仍未完成。不过,这项实验揭示了此类重建在哪些情况下有效、在哪些地方失效,以及哪些证据能使其具备临床意义。
该项目将 3D 形状拟合到两条 2D 轮廓上
据称,该流程将一个受约束的逆问题转化为小规模优化问题,但前提是完成大量几何准备工作。
根据这篇 双视图重建 帖子,目标是患者特异性的股骨远端,也就是大腿骨下端,包括构成膝关节的圆形表面。
建议使用的输入是两张正交轮廓图。其中一张为后前位视图,另一张为侧位视图。每张图像仅记录投影像素位于骨骼轮廓内还是轮廓外。
这些轮廓丢弃了内部密度、皮质骨厚度和骨小梁结构信息。它们从两个方向约束外部轮廓,却无法唯一确定隐藏表面的每一个点。
为应对这种歧义,作者使用 50 个 CT 衍生股骨网格构建了统计形状模型。统计形状模型通过平均表面和有限组协同变形模式来表示解剖结构变异。
该模型使用主成分分析(PCA)压缩对应表面点之间的变异。该流程并非独立优化每个顶点,而是调整 10 个形状系数。
这些系数使平均股骨沿参考集合中发现的主要变异模式发生变化。这一约束使优化更易处理,并避免任意且不符合解剖学规律的变形。
该流程还应用了马氏距离先验。这项惩罚衡量某个系数组合相对于模型观测分布的异常程度。因此,在拟合过程中,幅度过大或不太可能发生的变形代价更高。
在每个优化步骤中,当前的 3D 候选形状都会被投影到两个相机视图中。投影轮廓与目标轮廓进行比较,所得损失用于更新形状系数。
作者称,Adam 大约执行 1,000 次迭代。Adam 是一种基于梯度的优化器,在重复最小化损失时为每个参数自适应调整更新幅度。
这一梯度来自 可微渲染。PyTorch3D 的渲染器将图像空间中的差异回传至生成它们的顶点和参数。
传统光栅化会对三角形是否覆盖某个像素作出硬性判断。这些判断会产生难以通过优化处理的不连续性。
软光栅化将三角形边缘周围的锐利边界替换为连续概率。这样,投影轮廓就能逐步向目标移动,而不是得到突兀且信息量有限的信号。
作者在优化过程中退火渲染器的 sigma 参数。Sigma 控制边界柔和程度,因此退火开始时提供更宽容的梯度,最后得到更锐利的轮廓。
这种方法并非训练神经网络来预测解剖结构,而是针对预先计算的统计模型进行患者特异性优化。参考网格仍提供先验知识,但不存在已学习的图像到形状预测器。
这一差异很重要。该项目并未将训练数据从问题中完全移除,而是用较小但经过精细处理的对齐解剖表面集合,替代了大型有监督医学影像数据集。
其底层理念也早于这项实验。研究人员此前已使用统计模型和轮廓匹配,从经校准的双平面图像中重建股骨。新元素在于利用当前开源组件构建了一个易于获取的实现。
对应关系成为真正的 Horizon MachineLearning 故事
决定性的工程问题并非如何渲染股骨,而是如何确定 50 块不同骨骼上哪些表面点代表相同的解剖结构。
PCA 假设每个输入都包含含义一致的变量。对于图像而言,像素网格提供了这种一致性;解剖网格通常并不具备。
一根股骨上的第 4,000 个顶点可能位于髁部附近,另一根股骨上的第 4,000 个顶点则可能处于不同特征位置,甚至根本没有有意义的对应关系。
网格分辨率可能不同,三角形布局也可能变化。表面采样可能集中在某些区域,而在其他区域变得稀疏。
由错配顶点构建的统计模型无法学习清晰的解剖结构。它会混合无关位置,产生不稳定的变形模式,并生成表面明显粗糙的重建结果。
作者最初尝试了采用 KD-tree 的最近邻匹配。该方法根据空间邻近关系分配点,但邻近并不保证解剖等价。
最近邻匹配可能使对应关系跨越狭窄间隙发生折叠,或使其沿平滑表面滑动。微小的局部错误随后会在整个队列中累积。
帖子称,这种方法产生的表面粗糙度是参考 CT 表面的 50.7 倍。该数值是作者报告的诊断指标,并非独立确立的基准。
研究还测试了相干点漂移(CPD)。CPD 将一个点集视为概率混合模型中的质心,并使其以连贯方式向另一个点集移动。
据报告,粗糙度仍为 CT 衍生参考表面的 28.2 倍。贝叶斯 CPD 据称达到 47.5 倍,而 FilterReg 在作者的设置中未能成功完成。
这些结果不应被视为配准软件的通用排名。实现方式、初始化、预处理、超参数、拓扑结构和表面质量都可能显著影响每种方法。
但它们确实表明,在这一特定流程中,成对配准并不足够。将每根股骨独立匹配到单一模板,并未建立适用于 PCA 的群体级坐标系统。
ShapeWorks 改变了这一结果。其 粒子对应关系 工作流程会在完整形状集合中优化标志点,而不是将局部邻近关系直接视为对应关系。
该软件平衡两个目标:粒子应准确表示每个个体表面,同时它们在群体中的分布应形成紧凑的统计模型。
帖子称,使用 ShapeWorks 后,表面粗糙度为 CT 参考表面的 3.3 倍。这是唯一低于作者五倍验收门槛的测试结果。
这一验收门槛同样值得审视。帖子称该阈值在测试前选定,这减少了一种事后选择阈值的情况。然而,五倍粗糙度比并未对应任何临床意义。
表面粗糙度并不等同于重建准确性。平滑的股骨可能尺寸错误,而准确的表面也可能保留细小的分割伪影。
完整评估需要同时包含模型质量和患者层面的测量。紧凑性、泛化性和特异性描述统计模型;表面距离和解剖标志点则描述拟合结果。
下游指标同样重要。膝关节几何会影响植入物规划、力线分析和生物力学模拟。临床重要标志点周围的误差,可能比沿骨干出现的同等误差更重要。
尽管如此,对应关系结果仍传达了最具普遍性的经验:复杂的优化器无法挽救畸形的形状空间。
更好的损失函数或许能改善轮廓一致性,更多迭代或许能降低目标函数值,但二者都无法修复参考网格中原本就不代表同一事物的解剖变量。
小型形状先验挑战数据密集型重建
该项目对神经重建流程形成了一种挑战:它表明,强大的解剖学约束能够减少所需的数据量和监督信号。
医学影像团队在将图像映射为几何结构时,往往会选择神经模型。这条路线能够学习复杂关系,但需要合适的训练配对数据和谨慎的外部验证。
在这一场景中,配对数据尤其难以获得。一个有用的数据集需包含经校准的 X 光片、高质量分割,以及来自相同患者的对应 CT 衍生几何结构。
数据获取、知情同意、协议差异和标注工作量都会增加收集难度。临床人群在年龄、性别、疾病、植入物和采集设备方面也存在差异。
统计模型则采取了不同立场。人类股骨确实存在变异,但并不覆盖所有可能网格构成的完整空间。紧凑先验能够直接编码反复出现的解剖关系。
该项目的参考形状据称来自 MedShapeNet。更广泛的 医学形状数据集 在发布时包含来自 23 个组成数据集的逾 100,000 个带注释形状。
这一总数不应与项目中的股骨队列混为一谈。Reddit 作者称,只有 50 个 CT 衍生股骨网格进入了该模型。
借助 10 个系数,拟合过程在一个狭窄子空间内搜索,而不是预测数百万个无约束坐标。这使该系统比许多端到端模型更易解释。
每个系数都可与一个模型模式相联系、可视化、设定边界,并与其训练分布进行比较。马氏距离项也揭示了候选形状偏离参考群体的程度。
这种透明度并不会让结果天然更安全,但会让某些失效机制更容易被检查。
模型的核心限制很明确:它只能生成其平均形状和保留模式所代表的解剖结构,无法创造被形状基底排除的变形。
神经模型同样难以应对训练分布之外的情况。不过,其表示可能会用看似合理的输出和自信的预测掩盖这种失败。
统计方法使这种边界更加明显。系数达到允许范围时,便直接警示模型的覆盖范围不足。
这一特性可以支持一种实用的拒绝机制。软件不必为每种情况都返回看似可靠的网格,而是可以识别出需要进行 CT 检查或人工复核的患者。
不过,小数据优势依赖于成本高昂的上游工作。这 50 个表面需要经过分割、清理、对齐、对应关系优化和质量控制。
因此,该项目是用一种数据负担交换另一种数据负担。它避免了庞大的带标签图像集合,但要求拥有几何一致的解剖学队列。
这一路径也不同于从普通照片重建通用物体。X 光轮廓是经过校准的成像几何条件下解剖结构的投影,而非具有纹理和光照线索的彩色图像。
双视图比单视图更能约束尺度和外形,尤其是在相机彼此正交时。但它们仍无法消除对不可见凹陷和深度变化的歧义。
模型利用群体统计数据来填补这些空白。这正是其效率与风险的共同来源。
更大的神经系统或许能够吸收更多样的解剖结构、成像噪声和分割行为。紧凑型模型则提供了更清晰的约束、更低的数据需求,以及更窄的适用范围。
两条路线并不存在抽象意义上的胜负。真正相关的问题是,系统能否识别患者何时超出这一适用范围。
毫米级结果掩盖了覆盖范围失效
这些令人鼓舞的误差适用于范围内的合成目标,而极端解剖结构暴露了模型及其初始对齐的失效。
作者报告了对五个留出的股骨进行留一法测试。每次测试中,都会排除一个目标,并使用其余 49 个网格构建模型。
对于处于模型覆盖范围内的目标,报告的误差介于 0.86 至 1.43 毫米之间。公开文章未提供完整实验流程、分区域误差、置信区间或可下载的评估材料。
这些数值在该领域内具有技术上的合理性。一项先前的股骨远端研究在评估基于校准双平面图像的形状重建前,报告了亚毫米级的刚性配准精度。
其他研究也曾报告,在受控双平面条件下,下肢重建的平均误差约为毫米级。由于数据集、指标、校准方式和目标解剖结构不同,这些比较仍不完全可比。
当前项目的两个极端案例比其最佳数值更具参考价值。文章称,这两个目标都位于 49 个形状模型第一主成分模式的覆盖范围之外。
一旦目标超出该支持范围,优化器就没有任何有效系数能够复现它。增加迭代次数也无法创造缺失的解剖学方向。
这不只是优化器失效,而是表征失效。
作者还报告称,这些案例的桥接 ICP 对齐效果不佳,内点比例为 0.6。ICP,即迭代最近点算法,会通过反复匹配相近的几何结构并更新变换来估计对齐关系。
文章称,这一初始化误差对重建失败的影响大于形状拟合本身。这形成了两道相互作用的边界。
首先,目标必须被放置得足够接近模型,轮廓优化才能正确收敛。其次,模型必须包含足够的解剖学变异,才能表征该目标。
一条管线可能无法通过其中任何一项测试。它也可能在图像损失上通过,却返回错误的隐藏几何结构。
两个轮廓可以产生许多等价或近似等价的投影。一个股骨可能匹配两个外轮廓,却在两个视图都无法强力约束的区域存在差异。
马哈拉诺比斯先验会在这些可能性中选择一个看似合理的解。然而,这种合理性反映的是 49 个训练形状,而非普适的患者群体。
这一差异对于畸形、创伤、儿童解剖结构、既往手术、肿瘤和罕见形态尤为重要。这些病例可能恰恰是患者特异性几何结构最关键的场景。
在相对典型的成人解剖结构上训练的模型,可能恰恰会在临床上最不需要重建的地方表现最佳。它可能拒绝或平滑掉那些最需要三维评估的病例。
小规模验证集无法确立亚组表现。五个留出的表面可用于调试,但不足以支撑有关临床可靠性的主张。
留一法测试还会在每次评估中重复使用几乎整个队列。因此,各折结果彼此相关,测试人群也仍接近开发数据集。
独立的外部验证将提供更严格的测试。它应使用来自另一家机构、另一种扫描仪、另一套分割流程和另一类患者群体的股骨数据。
已发表文献对此领域也持谨慎态度。一篇髋部形状综述发现,统计模型能够将 X 光片与三维解剖结构联系起来,同时也指出了验证与人群覆盖方面的缺口。
因此,对 0.86 至 1.43 毫米结果的正确解读应当是有限的:这是在模拟条件下,针对选定且受模型支持的网格所报告的概念验证结果。
这并不能证明两张普通临床 X 光片可以替代 CT。也不能证明其适用于诊断、手术规划或植入物选择。
渲染器校准可能压过形状模型的影响
据称,一个对尺度敏感的渲染参数就能使精度相差 87 倍,这揭示了图像空间优化可能变得多么脆弱。
软光栅化需要在投影三角形边界周围设置一个过渡宽度。如果该宽度过大,轮廓会变得模糊,其损失函数就无法精确定位真实边界。
如果起始时的宽度过小,当前边界之外的梯度就会消失。当初始投影未命中目标时,优化器几乎得不到引导。
Sigma 退火解决了这一冲突。早期较宽的边界会吸引候选形状,而最终较窄的边界则支持精确拟合。
作者报告称,退火终点必须与生成参考渲染时使用的 sigma 相匹配。据称,为一种形状模型调优的常数用于另一种模型时,会导致精度下降 87 倍。
同样,这一说法来自公开项目描述。文章没有提供足够的材料来验证该比例,或分离出每个影响变量。
提出的修复方案是将终点设为相机范围乘以 0.0001。相机范围描述的是在所选坐标系下渲染场景的尺度。
这种归一化在概念上是合理的。以绝对模型单位表示的柔化值,在另一个采用不同尺度的数据集上会表现不同。
这一教训不仅适用于 sigma。相机校准、网格单位、图像分辨率、投影类型、裁剪平面和坐标约定都可能影响重建出的几何结构。
一种经过数据集特定调优后有效的方法,在移植到另一家医院时可能失效。不同系统可能以毫米、米、归一化坐标或相对于像素的单位编码距离。
合成实验可能掩盖这些不匹配,因为同一个渲染器既生成目标,也评估重建结果。前向模型与自身完全匹配。
真实 X 光片打破了这种对称性。它们包含放大效应、散射、解剖结构重叠、噪声、视野不完整、失真以及采集元数据错误。
它们的轮廓也不像二值合成轮廓那样干净。股骨远端可能与胫骨、髌骨、软组织、植入物或体位固定装置重叠。
该项目目前假定骨骼轮廓已经可用。作者将自动分割列为尚未完成的工作。
这一缺失环节影响重大。轮廓误差会成为优化器的几何指令,优化器将使股骨变形,以解释错误的像素。
因此,分割不确定性应纳入重建模型。系统可以降低模糊边界的权重,或将轮廓不确定性传播至最终表面的置信度中。
仅测试完美轮廓无法揭示这种行为。受控扰动有助于衡量其对边缘缺失、轮廓偏移和校准误差的敏感性。
第三个视图可以增加约束,因为损失函数能够汇总额外投影中的误差。但这也会增加采集复杂度,并偏离项目的双视图前提。
密度信息可能比二值轮廓提供更多证据,但这需要更现实的图像形成模型。它也会引入曝光、材料和衰减方面的假设。
简单的轮廓方法具有吸引力,因为它避免了这些变量。它的弱点在于,优化开始前就丢弃了信息。
正确的下一步不只是降低合成表面误差,而是检验当现实的采集误差进入流程后,整条管线是否仍能保持稳定。
三项测试将决定该方法能否推广
在报告的精度具有实际意义之前,该项目现在需要配对临床验证、更广泛的解剖覆盖,以及明确的失效检测。
第一个信号是在真实的配对 X 光片和 CT 数据上的表现。每位患者将提供两张经过校准的 X 光片用于重建,以及一个由 CT 导出的表面用于独立比较。
该测试应将 CT 几何结构排除在拟合过程之外。它还应区分分割误差、相机校准误差、配准误差和形状模型误差。
分区域表面距离会比单一的全局平均值更具参考价值。髁部、髁间切迹和手术标志物附近的误差应单独报告。
评估还应纳入与拟议用途相关的解剖测量。较小的平均距离并不能保证轴线、宽度、角度或植入物接触区域的准确性。
在配对病例上取得成功,将增强“合成轮廓拟合可以迁移至临床图像”的论断。若出现大幅下降,则表明当前渲染器解决的问题比放射摄影实际呈现的问题更干净、更简单。
第二个信号是覆盖更广泛队列的外部验证。50 个参考网格能够证明可行性,但对人口统计学和病理学变异的覆盖有限。
更大规模的研究应披露队列构成、排除标准、病理情况、侧别和分割流程。它还应保留一个完全独立的测试集。
最有价值的病例将位于模型边界附近或之外。只测试典型解剖结构,会掩盖两个极端示例中已经观察到的确切限制。
研究人员应报告,当更多参考形状和 PCA 模式纳入模型时,精度如何变化。更多模式可以改善覆盖范围,但也可能削弱正则化并引入不稳定变形。
这项实验将揭示,当前的 10 系数模型究竟捕捉到了持久的解剖学基础,还是仅高效地拟合了一个小型集合。
第三个信号是自动拒绝机制。系统应在任何人使用生成的网格前识别不可靠输入。
可能的警告包括:系数接近模型上限、较高的马哈拉诺比斯距离、较差的轮廓一致性、较低的 ICP 内点比例,或重复初始化之间存在不一致。
有用的置信度评分必须与未见患者上的实际三维误差相关。它不能仅依赖优化损失,因为即使轮廓匹配,隐藏表面仍可能出错。
前瞻性测试应在查看最终结果前明确设定拒绝阈值。这样可以避免在失败显现后再挑选有利的阈值。
如果这三项信号同时出现,该项目就不再只是一个有趣的几何演示。它将提供一条可检验的路径,在不常规使用 CT 的情况下实现有选择性的患者个体化重建。
如果真实图像上的准确性崩溃、在更广泛队列中的效果仍缺乏支持,或无法识别失败情况,那么较为保守的结论仍然具有意义。可微渲染能够拟合轮廓,但无法提供形状模型本身从未包含的解剖学证据。
对于关注 Horizon MachineLearning 讨论的开发者而言,眼下面临的挑战是可复现性。该领域需要代码、固定的数据划分、相机参数、对应关系设置,以及完整的误差分布。
对于医疗团队而言,问题则更严格:该方法能否识别出那些不应被重建的患者?这一答案比它取得的最佳毫米级结果更重要。



