Deux silhouettes radiographiques ont produit un fémur en 3D, mais la difficulté résidait dans la correspondance
Une discussion sur Horizon MachineLearning a mis en lumière un pipeline de reconstruction 3D reposant sur seulement deux silhouettes radiographiques et 50 maillages de fémurs de référence. Son auteur rapporte des erreurs à l’échelle millimétrique sur certaines formes mises de côté pour les tests, malgré l’absence de réseau neuronal ou de scanner patient lors de la reconstruction.
Le résultat le plus important est moins flatteur. Plusieurs méthodes courantes de correspondance ont produit des surfaces bien plus rugueuses que la géométrie d’origine dérivée de scanners. ShapeWorks a été la seule méthode testée à franchir le seuil d’acceptation prédéfini par l’auteur.
Cela déplace le débat des réseaux neuronaux face à la modélisation classique. L’enjeu central oppose un a priori anatomique compact à la diversité géométrique observée chez de vrais patients. Un modèle peut optimiser parfaitement ses coefficients tout en échouant lorsque l’anatomie cible se situe hors de l’espace de formes qu’il a appris.
Le travail a été partagé publiquement, et non publié sous la forme d’une étude évaluée par les pairs. Ses résultats numériques n’ont pas été reproduits de manière indépendante, et sa validation sur des radiographies réelles reste inachevée. L’expérience montre néanmoins où ce type de reconstruction réussit, où il échoue et quelles preuves lui donneraient une portée clinique.
Le projet ajuste une forme 3D à deux contours 2D
Le pipeline décrit transforme un problème inverse contraint en un petit problème d’optimisation, mais seulement après une préparation géométrique importante.
Selon le billet sur la reconstruction à deux vues, la cible est un fémur distal spécifique à un patient. Il s’agit de l’extrémité inférieure de l’os de la cuisse, y compris les surfaces arrondies qui forment l’articulation du genou.
Les entrées proposées sont deux silhouettes orthogonales. L’une représente une vue postéro-antérieure, tandis que l’autre représente une vue latérale. Chaque image indique uniquement si un pixel projeté se trouve à l’intérieur ou à l’extérieur du contour osseux.
Ces silhouettes éliminent la densité interne, l’épaisseur corticale et la structure trabéculaire. Elles contraignent le contour externe selon deux directions, mais ne déterminent pas de façon unique chaque point de la surface cachée.
Pour gérer cette ambiguïté, l’auteur a construit un modèle statistique de forme à partir de 50 maillages de fémurs dérivés de scanners. Un modèle statistique de forme représente la variation anatomique par une surface moyenne et un ensemble limité de motifs de déformation coordonnés.
Le modèle utilise l’analyse en composantes principales, ou PCA, pour compresser les variations entre des points de surface correspondants. Au lieu d’optimiser chaque sommet indépendamment, le pipeline ajuste 10 coefficients de forme.
Ces coefficients déplacent le fémur moyen selon les principaux motifs de variation identifiés dans la collection de référence. Cette restriction rend l’optimisation gérable et empêche des déformations arbitraires, anatomiquement peu plausibles.
Le pipeline applique également un a priori de Mahalanobis. Cette pénalité mesure à quel point une combinaison de coefficients est inhabituelle par rapport à la distribution observée du modèle. Les déformations importantes ou improbables deviennent donc plus coûteuses lors de l’ajustement.
À chaque étape d’optimisation, le candidat 3D courant est projeté dans les deux vues de caméra. Les silhouettes projetées sont comparées aux silhouettes cibles, et la perte obtenue met à jour les coefficients de forme.
L’auteur indique qu’Adam effectue environ 1 000 itérations. Adam est un optimiseur fondé sur le gradient qui adapte l’amplitude de mise à jour de chaque paramètre lors de minimisations répétées de la perte.
Ce gradient provient du rendu différentiable. Le moteur de rendu de PyTorch3D relie les différences dans l’espace image aux sommets et paramètres qui les ont produites.
La rastérisation conventionnelle prend des décisions strictes sur la question de savoir si un triangle couvre un pixel. Ces décisions créent des discontinuités difficiles à traverser par l’optimisation.
La rastérisation douce remplace les frontières nettes par des probabilités continues autour des bords des triangles. Un contour projeté peut alors se déplacer progressivement vers sa cible au lieu de recevoir un signal brutal et peu informatif.
L’auteur réduit progressivement le paramètre sigma du moteur de rendu pendant l’optimisation. Sigma contrôle la douceur des frontières : cette réduction commence donc avec des gradients tolérants et se termine avec un contour plus net.
Cette approche n’entraîne pas de réseau neuronal à prédire l’anatomie. Elle effectue une optimisation spécifique au patient par rapport à un modèle statistique précalculé. Les maillages de référence fournissent toujours des connaissances a priori, mais aucun prédicteur image-vers-forme n’est appris.
Cette distinction est importante. Le projet n’élimine pas les données d’entraînement du problème. Il remplace un vaste jeu de données d’imagerie supervisée par une collection plus réduite de surfaces anatomiques alignées et soigneusement traitées.
L’idée sous-jacente est également antérieure à cette expérience. Des chercheurs ont déjà reconstruit des fémurs à partir d’images biplanaires calibrées en utilisant des modèles statistiques et une mise en correspondance des contours. L’élément nouveau est une implémentation accessible fondée sur des composants open source actuels.
La correspondance est devenue la véritable histoire de Horizon MachineLearning
Le problème d’ingénierie déterminant n’était pas le rendu du fémur, mais la décision de savoir quels points de surface représentaient la même anatomie sur 50 os différents.
La PCA suppose que chaque entrée contient des variables ayant des significations cohérentes. Pour les images, la grille de pixels assure cette cohérence. Les maillages anatomiques ne l’assurent généralement pas.
Le sommet 4 000 d’un fémur peut se trouver près d’un condyle. Le sommet 4 000 d’un autre peut occuper une caractéristique différente ou ne présenter aucune relation significative.
Les résolutions de maillage peuvent varier. La disposition des triangles peut changer. L’échantillonnage de surface peut se concentrer dans certaines régions et devenir clairsemé dans d’autres.
Un modèle statistique construit à partir de sommets mal appariés n’apprend pas une anatomie nette. Il mélange des emplacements sans rapport, produisant des modes de déformation instables et des surfaces reconstruites visiblement rugueuses.
L’auteur a d’abord essayé une mise en correspondance par plus proches voisins avec un KD-tree. Cette méthode assigne les points selon leur proximité spatiale, mais la proximité ne garantit pas l’équivalence anatomique.
La mise en correspondance par plus proches voisins peut replier les correspondances à travers des espaces étroits ou les faire glisser le long de surfaces lisses. De petites erreurs locales s’accumulent ensuite à l’échelle de la cohorte.
Le billet indique que cette approche a généré une rugosité de surface 50,7 fois supérieure à celle de la surface de scanner de référence. Ce chiffre est un diagnostic rapporté par l’auteur, et non un benchmark établi de façon indépendante.
Coherent Point Drift, ou CPD, a également été testé. CPD traite un ensemble de points comme les centroïdes d’un mélange probabiliste et les déplace de manière cohérente vers un autre ensemble.
La rugosité rapportée est restée 28,2 fois supérieure à la référence dérivée du scanner. Le CPD bayésien aurait atteint 47,5 fois cette valeur, tandis que FilterReg ne s’est pas achevé correctement dans la configuration de l’auteur.
Ces résultats ne doivent pas devenir des classements universels des logiciels de recalage. Les implémentations, l’initialisation, le prétraitement, les hyperparamètres, la topologie et la qualité des surfaces peuvent fortement affecter chaque méthode.
Ils montrent que le recalage par paires était insuffisant dans ce workflow particulier. Apparier chaque fémur indépendamment à un modèle unique n’a pas créé un système de coordonnées à l’échelle de la population adapté à la PCA.
ShapeWorks a changé ce résultat. Son workflow de correspondance par particules optimise les repères sur l’ensemble de la collection de formes, au lieu d’accepter la proximité locale comme correspondance.
Le logiciel équilibre deux objectifs. Les particules doivent représenter précisément chaque surface individuelle, et leur distribution dans la population doit créer un modèle statistique compact.
Le billet rapporte une rugosité de surface 3,3 fois supérieure à la référence de scanner après l’utilisation de ShapeWorks. C’était le seul résultat testé inférieur au seuil d’acceptation fixé par l’auteur à cinq fois.
Ce seuil d’acceptation mérite également un examen attentif. Le billet indique qu’il a été sélectionné avant les tests, ce qui réduit une forme de sélection rétrospective du seuil. Toutefois, aucune signification clinique n’est associée à un ratio de rugosité de cinq fois.
La rugosité de surface n’est pas la même chose que la précision de reconstruction. Un fémur lisse peut avoir de mauvaises dimensions, et une surface précise peut conserver de petits artefacts de segmentation.
Une évaluation complète nécessite à la fois des mesures de qualité du modèle et des mesures au niveau du patient. La compacité, la généralisation et la spécificité décrivent le modèle statistique. La distance de surface et les repères anatomiques décrivent le résultat ajusté.
Les mesures en aval comptent également. La géométrie du genou influence la planification d’implants, l’analyse de l’alignement et la simulation biomécanique. Des erreurs autour d’un repère cliniquement important peuvent compter davantage que des erreurs égales le long de la diaphyse.
Le résultat sur la correspondance porte néanmoins la leçon générale la plus forte. Un optimiseur sophistiqué ne peut pas sauver un espace de formes mal formé.
De meilleures fonctions de perte pourraient améliorer la concordance des silhouettes. Davantage d’itérations pourraient réduire l’objectif. Aucune de ces modifications ne peut réparer des variables anatomiques qui n’ont jamais représenté la même chose d’un maillage de référence à l’autre.
Un petit a priori de forme remet en question la reconstruction gourmande en données
Le projet met sous pression les pipelines de reconstruction neuronale en montrant que de fortes contraintes anatomiques peuvent réduire la quantité de données et de supervision nécessaire.
Les équipes d’imagerie médicale se tournent souvent vers un modèle neuronal pour passer des images à la géométrie. Cette voie peut apprendre des relations complexes, mais elle exige des paires d’entraînement adaptées et une validation externe rigoureuse.
Les données appariées sont particulièrement difficiles à obtenir ici. Un jeu de données utile inclurait des radiographies calibrées, une segmentation de haute qualité et la géométrie correspondante dérivée de scanners chez les mêmes patients.
L’accès, le consentement, les différences de protocole et l’effort d’annotation compliquent la collecte. Les populations cliniques varient également selon l’âge, le sexe, la maladie, les implants et le matériel d’acquisition.
Un modèle statistique adopte une position différente. Les fémurs humains varient, mais ils n’occupent pas tout l’univers des maillages possibles. Un a priori compact peut encoder directement des relations anatomiques récurrentes.
Les formes de référence du projet proviendraient de MedShapeNet. Le jeu de données médical de formes plus large a été présenté avec plus de 100 000 formes annotées réparties dans 23 jeux de données constitutifs.
Ce total ne doit pas être confondu avec la cohorte de fémurs du projet. L’auteur sur Reddit indique que seulement 50 maillages de fémurs dérivés de scanners ont été intégrés à ce modèle.
Avec 10 coefficients, le processus d’ajustement explore un sous-espace étroit au lieu de prédire des millions de coordonnées non contraintes. Cela rend le système plus interprétable que de nombreux modèles de bout en bout.
Un coefficient peut être relié à un mode du modèle, visualisé, borné et comparé à sa distribution d’entraînement. Le terme de Mahalanobis révèle également à quel point un candidat s’écarte de la population de référence.
Cette transparence ne rend pas intrinsèquement le résultat plus sûr. Elle rend certains mécanismes d’échec plus faciles à examiner.
La limite centrale du modèle est explicite : il ne peut générer que l’anatomie représentée par sa moyenne et ses modes retenus. Il ne peut pas inventer une déformation exclue par la base de formes.
Un modèle neuronal rencontre lui aussi des difficultés en dehors de sa distribution d’entraînement. Toutefois, sa représentation peut masquer cet échec derrière une sortie d’apparence plausible et une prédiction assurée.
L’approche statistique rend cette frontière plus visible. Un coefficient atteignant sa plage autorisée constitue un avertissement direct que le modèle manque de couverture.
Cette propriété pourrait étayer un système de rejet utile. Au lieu de renvoyer un maillage rassurant dans tous les cas, le logiciel pourrait identifier les patients nécessitant un scanner CT ou une vérification manuelle.
Pourtant, l’avantage lié aux petites quantités de données dépend d’un travail préparatoire coûteux. Les 50 surfaces ont nécessité une segmentation, un nettoyage, un alignement, une optimisation des correspondances et un contrôle qualité.
Le projet échange donc une contrainte de données contre une autre. Il évite une vaste collection d’images annotées, mais exige une cohorte anatomique géométriquement cohérente.
Cette approche diffère également de la reconstruction d’un objet générique à partir de photographies ordinaires. Les silhouettes radiographiques sont des projections de l’anatomie selon une géométrie d’imagerie calibrée, et non des images en couleur contenant des indices de texture et d’éclairage.
Deux vues contraignent mieux l’échelle et le contour qu’une seule, en particulier lorsque les caméras sont orthogonales. Elles laissent toutefois ambiguës les dépressions invisibles et les variations de profondeur.
Le modèle comble ces lacunes à l’aide de statistiques de population. C’est le mécanisme à l’origine de son efficacité comme de son risque.
Un système neuronal plus vaste pourrait intégrer une anatomie plus diverse, le bruit d’imagerie et les comportements de segmentation. Le modèle compact offre des contraintes plus claires, des besoins en données moindres et un domaine d’utilisation plus restreint.
Aucune de ces voies ne l’emporte dans l’absolu. La question pertinente est de savoir si un système reconnaît lorsqu’un patient se situe hors de ce domaine.
Les résultats millimétriques masquent une défaillance de couverture
Les erreurs prometteuses s’appliquent à des cibles synthétiques dans la plage couverte, tandis que des anatomies extrêmes ont révélé des défaillances du modèle et de son alignement initial.
L’auteur rapporte des tests leave-one-out sur cinq fémurs mis de côté. À chaque essai, une cible est exclue tandis qu’un modèle est construit à partir des 49 maillages restants.
Pour les cibles comprises dans la plage représentée par le modèle, les erreurs rapportées vont de 0,86 à 1,43 millimètre. La publication publique ne fournit ni protocole complet, ni erreurs par région, ni intervalles de confiance, ni artefacts d’évaluation téléchargeables.
Ces valeurs sont techniquement plausibles dans ce domaine. Une précédente étude sur le fémur distal a rapporté une précision d’enregistrement rigide inférieure au millimètre avant d’évaluer la reconstruction de forme à partir d’images biplanaires calibrées.
D’autres travaux ont fait état d’erreurs moyennes d’environ un millimètre pour la reconstruction du membre inférieur dans des conditions biplanaires contrôlées. Les comparaisons restent imparfaites, car les jeux de données, les métriques, le calibrage et l’anatomie ciblée diffèrent.
Les deux cas extrêmes du projet actuel sont plus instructifs que ses meilleurs chiffres. La publication indique que les deux cibles se situaient hors de la couverture du modèle à 49 formes le long de son premier mode PCA.
Une fois la cible au-delà de cette plage prise en charge, l’optimiseur ne disposait d’aucun coefficient valide capable de la reproduire. Des itérations supplémentaires ne pouvaient pas créer une direction anatomique absente.
Il ne s’agit pas seulement d’une défaillance de l’optimiseur. C’est une défaillance de représentation.
L’auteur rapporte également un mauvais alignement ICP intermédiaire pour ces cas, avec une fraction d’inliers de 0,6. ICP, ou iterative closest point, estime l’alignement en associant de manière répétée des géométries proches et en mettant à jour une transformation.
La publication indique que cette erreur d’initialisation a davantage contribué aux reconstructions échouées que l’ajustement de forme. Cela crée deux limites qui interagissent.
Premièrement, la cible doit être placée suffisamment près du modèle pour que l’optimisation des silhouettes converge correctement. Deuxièmement, le modèle doit contenir assez de variation anatomique pour représenter la cible.
Un pipeline peut échouer à l’un ou l’autre de ces tests. Il peut aussi réussir la perte d’image tout en renvoyant une géométrie cachée erronée.
Deux silhouettes créent de nombreuses projections équivalentes ou quasi équivalentes. Un fémur peut correspondre aux deux contours tout en différant dans des régions qu’aucune des deux vues ne contraint fortement.
Le prior de Mahalanobis sélectionne une solution plausible parmi ces possibilités. Toutefois, cette plausibilité reflète les 49 formes d’entraînement, et non une population universelle de patients.
Cette distinction devient importante en cas de déformation, de traumatisme, d’anatomie pédiatrique, de chirurgie antérieure, de tumeurs et de morphologie inhabituelle. Ces cas peuvent être précisément ceux où une géométrie spécifique au patient compte le plus.
Un modèle entraîné sur une anatomie adulte relativement typique pourrait obtenir ses meilleures performances là où la reconstruction est le moins nécessaire sur le plan clinique. Il pourrait rejeter ou lisser précisément les cas nécessitant une évaluation tridimensionnelle.
Le petit ensemble de validation ne peut pas établir les performances par sous-groupe. Cinq surfaces mises de côté sont utiles pour le débogage, mais ne peuvent étayer des affirmations sur la fiabilité clinique.
Les tests leave-one-out réutilisent également la quasi-totalité de la cohorte pour chaque évaluation. Les résultats entre les plis sont donc corrélés, et la population de test reste proche du jeu de données de développement.
Une validation externe indépendante fournirait un test plus exigeant. Elle devrait utiliser des fémurs provenant d’un autre établissement, scanner, processus de segmentation et population de patients.
La littérature publiée traite déjà ce domaine avec prudence. Une revue sur la forme de la hanche a constaté que les modèles statistiques peuvent relier les radiographies à l’anatomie 3D, tout en relevant des lacunes de validation et de population.
L’interprétation correcte des 0,86 à 1,43 millimètre est donc limitée. Il s’agit d’un résultat de preuve de concept rapporté pour des maillages sélectionnés et pris en charge par le modèle, dans des conditions simulées.
Ce n’est pas une preuve que deux radiographies cliniques ordinaires peuvent remplacer un scanner CT. Ce n’est pas une preuve en faveur d’un usage diagnostique, de la planification chirurgicale ou de la sélection d’implants.
Le calibrage du renderer peut dominer le modèle de forme
Un seul paramètre de rendu sensible à l’échelle aurait modifié la précision d’un facteur 87, révélant la fragilité que peut atteindre l’optimisation dans l’espace image.
La rasterisation douce nécessite une largeur de transition autour des limites projetées des triangles. Si cette largeur est trop grande, la silhouette devient floue et sa perte ne peut pas localiser précisément le véritable contour.
Si la largeur est trop faible au départ, les gradients disparaissent loin de la frontière actuelle. L’optimiseur reçoit alors peu d’indications lorsque la projection initiale manque la cible.
L’annealing de sigma répond à ce conflit. Une frontière large au début attire la forme candidate, tandis qu’une frontière étroite à la fin permet un ajustement précis.
L’auteur rapporte que le point final de l’annealing devait correspondre au sigma utilisé pour générer le rendu de référence. Une constante réglée pour un modèle de forme aurait causé une dégradation de précision par un facteur 87 sur un autre.
Là encore, il s’agit d’une affirmation issue de la description publique du projet. La publication ne fournit pas suffisamment d’artefacts pour vérifier ce ratio ou isoler chaque variable contributrice.
La correction proposée reliait le point final à l’étendue de la caméra multipliée par 0,0001. L’étendue de la caméra décrit l’échelle de la scène rendue dans le système de coordonnées choisi.
Cette normalisation est cohérente sur le plan conceptuel. Une valeur de douceur exprimée en unités absolues du modèle se comportera différemment lorsqu’un autre jeu de données utilise une échelle différente.
La leçon dépasse sigma. Le calibrage de la caméra, les unités du maillage, la résolution d’image, le type de projection, les plans de clipping et les conventions de coordonnées peuvent tous influencer la géométrie reconstruite.
Une méthode fonctionnant après un réglage spécifique à un jeu de données pourrait échouer lorsqu’elle est exportée vers un autre hôpital. Différents systèmes peuvent encoder les distances en millimètres, en mètres, en coordonnées normalisées ou en unités relatives aux pixels.
Les expériences synthétiques peuvent masquer ces incompatibilités, car le même renderer crée la cible et évalue la reconstruction. Le modèle direct est parfaitement adapté à lui-même.
Les radiographies réelles rompent cette symétrie. Elles comprennent de l’agrandissement, de la diffusion, des anatomies superposées, du bruit, de la distorsion, des champs de vision incomplets et des erreurs dans les métadonnées d’acquisition.
Leurs contours sont également moins nets que des silhouettes synthétiques binaires. Le fémur distal peut se superposer au tibia, à la rotule, aux tissus mous, à des implants ou à des dispositifs de positionnement.
Le projet suppose actuellement que le contour osseux est déjà disponible. L’auteur identifie la segmentation automatique comme un travail inachevé.
Cette étape manquante est considérable. Une erreur de contour devient une instruction géométrique pour l’optimiseur, qui déformera le fémur afin d’expliquer les mauvais pixels.
L’incertitude de segmentation devrait donc entrer dans le modèle de reconstruction. Le système pourrait accorder moins de poids aux limites ambiguës ou propager l’incertitude des contours dans sa confiance finale sur la surface.
Tester uniquement des silhouettes parfaites ne peut pas révéler ce comportement. Des perturbations contrôlées aideraient à mesurer la sensibilité aux bords manquants, aux contours décalés et aux erreurs de calibrage.
Une troisième vue pourrait ajouter des contraintes, car la perte peut additionner les erreurs sur des projections supplémentaires. Elle augmenterait aussi la complexité de l’acquisition et s’éloignerait du principe à deux vues du projet.
Les informations de densité pourraient apporter davantage d’éléments qu’un contour binaire, mais cela exigerait un modèle de formation d’image plus réaliste. Cela introduirait également des hypothèses sur l’exposition, les matériaux et l’atténuation.
La formulation simple par silhouettes est attrayante parce qu’elle évite ces variables. Sa faiblesse est qu’elle élimine de l’information avant le début de l’optimisation.
La prochaine étape appropriée n’est pas simplement de réduire l’erreur de surface synthétique. Elle consiste à vérifier si l’ensemble du pipeline reste stable lorsque des erreurs d’acquisition réalistes entrent dans la boucle.
Trois tests détermineront si l’approche est transférable
Le projet a désormais besoin d’une validation clinique appariée, d’une couverture anatomique plus large et d’une détection explicite des échecs avant que sa précision rapportée n’ait une signification pratique.
Le premier indicateur est la performance sur des données appariées de radiographies réelles et de CT. Chaque patient fournirait deux radiographies calibrées pour la reconstruction et une surface issue d’un CT pour une comparaison indépendante.
Ce test devrait conserver la géométrie CT hors du processus d’ajustement. Il devrait également séparer l’erreur de segmentation, l’erreur de calibrage de la caméra, l’erreur d’enregistrement et l’erreur du modèle de forme.
Les distances de surface par région seraient plus informatives qu’une seule moyenne globale. Les erreurs près des condyles, de l’échancrure intercondylaire et des repères chirurgicaux méritent une présentation distincte.
L’évaluation devrait inclure des mesures anatomiques pertinentes pour l’usage envisagé. Une faible distance moyenne ne garantit pas des axes, largeurs, angles ou régions de contact avec l’implant précis.
La réussite sur des cas appariés renforcerait l’affirmation selon laquelle l’ajustement de silhouettes synthétiques se transfère aux images cliniques. Une baisse importante montrerait que le renderer actuel résout un problème plus propre que celui présenté par la radiographie.
Le deuxième indicateur est une validation externe sur une cohorte plus large. Cinquante maillages de référence peuvent établir la faisabilité, mais ils offrent une couverture limitée des variations démographiques et pathologiques.
Une étude plus vaste devrait divulguer la composition de la cohorte, les critères d’exclusion, les pathologies, la latéralité et les procédures de segmentation. Elle devrait également réserver un ensemble de test complètement indépendant.
Les cas les plus utiles se situeront près de la limite du modèle ou au-delà. Tester uniquement une anatomie typique masquerait la limitation exacte déjà observée dans les deux exemples extrêmes.
Les chercheurs devraient indiquer comment la précision évolue à mesure que davantage de formes de référence et de modes PCA entrent dans le modèle. Davantage de modes peut améliorer la couverture, mais peut aussi affaiblir la régularisation et introduire des déformations instables.
Cette expérience révélerait si le modèle actuel à 10 coefficients capture une base anatomique durable ou s’il ajuste simplement efficacement une petite collection.
Le troisième indicateur est un mécanisme de rejet automatique. Le système devrait identifier les entrées peu fiables avant que quiconque n’utilise le maillage résultant.
Les avertissements possibles comprennent des coefficients proches des limites du modèle, une distance de Mahalanobis élevée, un mauvais accord des silhouettes, une faible fraction d’inliers ICP ou un désaccord entre des initialisations répétées.
Un score de confiance utile doit être corrélé à l’erreur 3D réelle chez des patients non vus. Il ne peut pas reposer uniquement sur la perte d’optimisation, car les surfaces cachées peuvent rester erronées malgré des contours correspondants.
Les tests prospectifs devraient définir les seuils de rejet avant d’examiner les résultats finaux. Cela évite de sélectionner des seuils favorables une fois les échecs devenus visibles.
Si ces trois signaux apparaissent conjointement, le projet deviendrait plus qu’une intéressante démonstration géométrique. Il proposerait une voie vérifiable vers une reconstruction sélective et spécifique à chaque patient, sans CT systématique.
Si la précision sur des images réelles s’effondre, si des cohortes plus larges restent non étayées, ou si les échecs ne peuvent pas être détectés, la conclusion plus restreinte conservera néanmoins son importance. Le rendu différentiable peut ajuster des silhouettes, mais il ne peut pas fournir de preuves anatomiques absentes du modèle de forme.
Pour les développeurs qui suivent le fil Horizon MachineLearning, le défi immédiat est la reproductibilité. Le domaine a besoin du code, de répartitions de données fixes, des paramètres de caméra, des réglages de correspondance et de distributions complètes des erreurs.
Pour les équipes médicales, la question est plus exigeante : la méthode peut-elle reconnaître le patient qu’elle ne devrait pas reconstruire ? Cette réponse compte davantage que son meilleur résultat au millimètre près.



