Le LLM médical de Sakura Internet s’ouvre aux chercheurs, pas à l’usage clinique
Sakura Internet a rendu son LLM médical disponible via une plateforme d’IA nationale, affichant un score de 93,3 % sur un benchmark d’examen médical japonais. Pourtant, le LLM médical de Sakura Internet n’était proposé qu’à des fins de recherche, dans le cadre d’un essai qui s’est achevé le 31 août 2026.
Cette limite compte davantage que le score mis en avant. Le modèle a donné aux chercheurs un accès pratique à une IA médicale japonaise sans les obliger à exploiter eux-mêmes un système de 109 milliards de paramètres. Il n’est pas devenu un service de diagnostic, un assistant clinique ni un produit commercial accessible au grand public.
La publication a également mis à l’épreuve une proposition plus large. Le Japon souhaite des systèmes d’IA hébergés localement, reflétant sa langue, ses normes médicales et ses exigences en matière de gouvernance des données. Sakura Internet positionne son infrastructure informatique nationale comme une alternative à l’envoi de charges de travail sensibles vers des fournisseurs mondiaux d’IA.
OpenAI o1 et GPT-4o ont fourni les références de performance les plus visibles dans l’annonce initiale. Toutefois, réussir des questions d’examen et soutenir le travail clinique restent deux épreuves distinctes. La véritable concurrence n’oppose donc pas un modèle à un autre. Elle oppose le contrôle national à la commodité et au rythme de développement rapide des plateformes mondiales d’IA.
Ce que le LLM médical de Sakura Internet a réellement changé
Le changement important concernait l’accès : les chercheurs pouvaient utiliser un grand modèle médical japonais via une interface hébergée au lieu de mettre eux-mêmes en place son infrastructure.
Le 5 mars 2026, Sakura Internet a commencé à fournir Weblab-MedLLM-Qwen-2.5-109B-Instruct via Sakura AI Engine. L’entreprise a limité l’accès aux usages de recherche et l’a proposé gratuitement pendant la période d’essai annoncée.
Le modèle provenait du laboratoire Matsuo-Iwasawa de l’Université de Tokyo et d’une collaboration de recherche plus vaste. Parmi les participants figuraient Sakura Internet, ELYZA, ABEJA, RIKEN et des établissements médicaux. Le programme japonais de promotion stratégique de l’innovation interministérielle a soutenu ces travaux.
Le nom du modèle révèle une partie de son héritage technique. Il utilisait Qwen 2.5 comme base et comptait 109 milliards de paramètres, les valeurs apprises servant à générer les réponses. Les chercheurs l’ont ensuite adapté à partir de contenus médicaux japonais.
Selon la publication du modèle, il a répondu correctement à 93,3 % des questions d’un benchmark fondé sur l’examen médical national japonais de 2025. Sakura a indiqué que ce résultat dépassait les scores enregistrés par OpenAI o1 et GPT-4o dans la même comparaison.
Ce chiffre appelle une formulation prudente. Il a été communiqué par les organisations impliquées, selon leur propre protocole d’évaluation. Il ne démontrait pas que le modèle pouvait diagnostiquer des patients avec une précision de 93,3 %.
L’Université de Tokyo a également évalué une tâche administrative concrète. Le modèle a converti des termes liés aux maladies infectieuses et aux analyses de laboratoire en appellations standard avec un score F1 de 85 %. Le score F1 combine précision et rappel en une seule mesure de la qualité de classification.
Ce cas d’usage illustre la valeur pratique potentielle d’un LLM médical japonais. Les hôpitaux enregistrent souvent des concepts similaires sous des libellés, abréviations ou codes locaux différents. Automatiser une partie de cette normalisation pourrait réduire les tâches répétitives liées aux données et améliorer l’interopérabilité.
Les résultats de recherche ont néanmoins imposé une restriction explicite. Les utilisateurs pouvaient poser des questions sur les connaissances médicales, mais le service ne pouvait pas être utilisé pour le diagnostic, la pratique médicale ou le traitement.
Le service comportait également une importante notice relative aux données. Les prompts, résultats et retours utilisateurs soumis pendant l’essai pouvaient être utilisés dans des recherches ultérieures. Cette condition rendait l’interface publique inadaptée aux véritables informations de patients.
L’accès a été ouvert du 5 mars au 31 août. Au 26 septembre, la période publique annoncée est terminée. Tout accès maintenu ou renouvelé requiert désormais une confirmation distincte des opérateurs.
Ce calendrier modifie la manière dont les lecteurs doivent interpréter la nouvelle. Sakura a démontré qu’elle pouvait héberger le modèle et le mettre à disposition d’une communauté de recherche. Elle n’a pas annoncé de disponibilité permanente et sans restriction pour les organisations de santé.
Cette distinction permet de reconnaître l’utilité de la réalisation sans en exagérer la portée. La plateforme a supprimé un obstacle d’infrastructure à l’expérimentation. Elle n’a pas supprimé les obstacles de validation, de confidentialité, de flux de travail et de responsabilité qui entourent le déploiement clinique.
Pourquoi l’hébergement national est le point stratégique
Sakura Internet vend le contrôle sur l’endroit où l’IA s’exécute, tandis que les fournisseurs mondiaux rivalisent par la qualité des modèles, leur portée auprès des développeurs et la vitesse de leurs lancements.
Les modèles de langage médicaux ont besoin de plus qu’un vocabulaire spécialisé. Leur environnement d’exploitation doit prendre en compte les dossiers sensibles, les contrôles institutionnels, les exigences d’audit et les conséquences de résultats incorrects. Ces contraintes font de l’architecture d’hébergement une composante du produit.
Sakura AI Engine est une plateforme d’inférence, ce qui signifie qu’elle exécute des modèles entraînés pour générer des réponses, plutôt que de les entraîner depuis le départ. Les utilisateurs peuvent appeler les modèles pris en charge via des interfaces de programmation d’applications et un playground accessible par navigateur.
La documentation de la plateforme indique que Sakura héberge elle-même tous les modèles pris en charge. Elle précise également que les communications des clients restent entre le client et Sakura, et que les données de chat soumises ne servent pas à entraîner les modèles hébergés.
Ces conditions générales de plateforme ne sont pas identiques aux conditions de l’essai de recherche médical. L’Université de Tokyo a averti que les interactions réalisées pendant l’essai pourraient alimenter de futures recherches. Les acheteurs doivent donc examiner les règles associées à chaque interface et à chaque modèle, et pas seulement au cloud sous-jacent.
Cette différence illustre la complexité de l’IA souveraine. Une infrastructure nationale peut clarifier la juridiction et réduire la dépendance à l’égard du traitement à l’étranger. Elle ne produit pas automatiquement une politique cohérente pour chaque application bâtie sur cette infrastructure.
Le modèle rend également l’infrastructure nationale visible pour les chercheurs qui, autrement, se tourneraient par défaut vers une API internationale. Un LLM médical japonais hébergé peut soutenir des tests contrôlés sans obliger chaque laboratoire à sécuriser des centaines d’accélérateurs.
Sakura a construit l’environnement sous-jacent de développement du modèle à une échelle considérable. Son cluster de calcul haute performance SAKURAONE contient 800 processeurs graphiques Nvidia H100 répartis sur 100 nœuds. Le système utilise une conception réseau Ethernet ouverte plutôt qu’une interconnexion propriétaire.
Le cluster a atteint 33,95 pétaflops sur le benchmark High Performance Linpack et s’est classé 49e dans la liste TOP500 de juin 2025. Sakura a indiqué qu’il s’agissait du seul système du top 100 utilisant une pile réseau entièrement ouverte.
Ces détails d’infrastructure ne sont pas décoratifs. L’entraînement de grands modèles génère des pics de demande concentrée que les déploiements de cloud d’entreprise ordinaires ne peuvent pas toujours gérer efficacement. Sakura a observé que les tâches utilisant au moins 17 nœuds absorbaient la majeure partie du temps GPU durant le projet médical.
Son analyse du cluster a constaté que 13,6 % des tâches utilisant de 17 à 32 nœuds s’exécutaient pendant plus d’une semaine. Les charges de travail se sont ensuite déplacées des grands entraînements vers des exécutions de fine-tuning plus modestes.
Cette évolution explique la logique commerciale de Sakura. L’entreprise peut soutenir la création de modèles sur un cluster de calcul administré, puis servir les modèles finalisés via Sakura AI Engine. Elle construit une chaîne nationale allant de l’entraînement à l’accès aux applications.
Les fournisseurs mondiaux conservent d’importants avantages. OpenAI, Google et Anthropic mettent fréquemment à jour leurs modèles généralistes et soutiennent de vastes communautés de développeurs. Leurs systèmes bénéficient aussi d’outils, de fonctions multimodales et d’intégrations d’entreprise établies.
La réponse de Sakura ne se limite pas à un meilleur score d’examen. Elle réside dans sa capacité à combiner une spécialisation japonaise avec une infrastructure qui reste sous le contrôle d’un opérateur national. Les organisations de santé peuvent alors évaluer une voie de déploiement davantage contrôlée localement.
Cette position met les deux camps sous pression. Les fournisseurs internationaux doivent expliquer comment ils répondent aux exigences cliniques japonaises et au traitement des dossiers sensibles. Les fournisseurs nationaux doivent démontrer que le contrôle n’oblige pas les clients à accepter des modèles moins performants ou une amélioration plus lente.
Un score de 93,3 % ne constitue pas une preuve clinique
Le compromis central est clair : les performances sur benchmark peuvent justifier des tests supplémentaires, mais le déploiement médical exige des preuves qu’un examen ne peut pas fournir.
Un examen médical national constitue un benchmark raisonnable des connaissances. Il teste la capacité d’un modèle à récupérer et à appliquer des concepts médicaux exprimés en japonais. Il offre également un point de comparaison familier entre les systèmes.
Toutefois, une question d’examen présente généralement un énoncé défini et une réponse attendue. Les dossiers cliniques contiennent du contexte manquant, des abréviations locales, des contradictions, des détails historiques et des informations saisies par de nombreuses personnes. L’action correcte peut également dépendre de faits extérieurs au dossier.
Un modèle peut donc obtenir un bon score tout en restant peu fiable dans les soins quotidiens. Il peut fournir une réponse fluide à une question claire et mal traiter une note ambiguë. Il peut aussi présenter des informations incertaines avec une confiance injustifiée.
Le résultat de 93,3 % concernait Weblab-MedLLM-Qwen-2.5-109B-Instruct et le benchmark de l’examen médical de 2025. Des travaux ultérieurs menés dans le cadre d’un projet NEDO distinct ont évalué des modèles, des tâches et des méthodes de sécurité plus récents. Ces résultats ne doivent pas être regroupés dans un score unique.
L’évaluation administrative du modèle initial était plus pertinente sur le plan opérationnel. La conversion de noms d’analyses incohérents en terminologie standard ressemble à un travail que les hôpitaux effectuent déjà. Même dans ce cas, un score F1 de 85 % laisse subsister des erreurs nécessitant une vérification.
L’interface annoncée interdisait aussi le diagnostic et le traitement. Cette limite n’était pas une simple note juridique secondaire. Elle définissait le modèle comme un instrument de recherche plutôt que comme un système médical autonome.
La supervision humaine demeure essentielle, mais cette expression peut masquer des questions pratiques. Qui examine chaque résultat, et combien de temps cette vérification demande-t-elle ? Un examinateur peut-il détecter une erreur formulée avec assurance avant qu’elle n’entre dans un autre système ?
Un outil utile doit réduire le travail après ces contrôles, et non simplement déplacer le travail ailleurs. Si les cliniciens doivent reconstituer chaque réponse à partir des dossiers sources, le modèle peut ajouter une couche de vérification sans générer d’économies significatives.
La comparaison avec les modèles d’OpenAI appelle une autre prudence. Un meilleur score sur un benchmark japonais ne démontre pas une supériorité générale. Les systèmes mondiaux peuvent produire des résultats différents en matière de synthèse, de raisonnement, de recherche d’information, de programmation, de vision ou de tâches multilingues.
L’inverse est également vrai. Les capacités étendues d’un modèle généraliste ne garantissent pas son alignement sur la terminologie japonaise, les recommandations de traitement ou les formats de données hospitalières. La spécialisation peut améliorer un flux de travail étroitement défini, même si elle ne remporte pas tous les benchmarks.
Le parcours d’évaluation le plus crédible commence donc par des tâches précises. La normalisation des dossiers médicaux, la préparation de registres, la rédaction de résumés de sortie et la recherche documentaire produisent chacun des résultats mesurables. Les chercheurs peuvent comparer les erreurs avec le travail humain et les logiciels existants.
L’initiative japonaise de LLM médical est la plus solide lorsqu’elle est présentée de cette manière. Il ne s’agit pas d’un médecin de substitution. Il s’agit d’une plateforme permettant de tester si des modèles de langage spécialisés peuvent réduire en toute sécurité les charges administratives.
Ce cadrage aide également les institutions à attribuer les responsabilités. Un hôpital peut concevoir des étapes d’approbation pour un projet de résumé ou une suggestion de code. Il ne peut pas déléguer la responsabilité finale à un score de benchmark.
La fenêtre fermée de l’essai crée une lacune supplémentaire en matière de vérification. Les chercheurs externes ont besoin d’un accès continu, de documentation et d’évaluations reproductibles pour tester les affirmations initiales. Une démonstration temporaire fait l’objet de moins d’examen qu’un service de recherche pérenne.
Sakura et l’Université de Tokyo ont réussi à rendre un grand modèle testable pendant plusieurs mois. L’étape suivante est plus difficile. Elles doivent montrer que les résultats tiennent dans différents établissements, face à l’évolution des connaissances médicales et à des données opérationnelles imparfaites.
Les résultats ultérieurs montrent des progrès et une cible mouvante
La publication de mars constituait une étape d’un programme plus vaste, et les modèles ultérieurs ont déplacé les éléments de preuve des notes d’examen vers la sécurité et les flux de travail administratifs.
En juin 2025, Sakura a signé un contrat avec la New Energy and Industrial Technology Development Organization du Japon. Le projet était centré sur la validation de la sécurité et les tests pratiques d’un modèle médical japonais.
Le contrat NEDO avait une valeur totale d’environ 4,5 milliards de yens. Environ 2 milliards de yens étaient consacrés aux ressources de cloud GPU, tandis que 2,5 milliards de yens couvraient d’autres services et activités de recherche conjointe.
Le contrat devait s’achever en mars 2026. Il reliait l’activité d’infrastructure de Sakura à un programme de recherche réunissant dix organisations, dont des universités, instituts de recherche, entreprises technologiques et établissements médicaux.
Une publication du 28 mai décrivait les résultats ultérieurs du programme. Il ne s’agissait pas simplement d’une répétition du score de 93,3 % du modèle Qwen 2.5 à l’examen. La collaboration a testé plusieurs modèles plus récents, adaptés ou développés de manière indépendante.
Un modèle de l’Université de Tokyo a atteint 90,8 % dans une tâche d’examen de spécialité en utilisant la génération augmentée par récupération. La RAG, ou génération augmentée par récupération, fournit des documents externes à un modèle avant qu’il ne réponde.
La référence commerciale a atteint 91,4 % dans cette tâche. Le résultat plaçait le modèle adapté près du système commercial cité, mais pas au-dessus. Il illustrait également la rapidité avec laquelle les comparaisons évoluent à mesure que les générations de modèles progressent.
Le meilleur modèle adapté a progressé de 10,8 points de pourcentage par rapport à son modèle de base lors d’une évaluation de directives cliniques japonaises. Ce résultat soutient l’adaptation au domaine, c’est-à-dire le processus d’entraînement d’un modèle existant avec des contenus spécialisés.
Le projet a également créé un benchmark japonais de sécurité médicale contenant plus de 50 000 interactions. Les chercheurs ont réalisé des tests de red team à l’échelle de 6 000 cas afin d’examiner la résistance aux requêtes adverses.
Ces exercices ont révélé une conclusion moins commode. Selon le projet, le choix du modèle de base influençait fortement la survie de la sécurité après un entraînement médical supplémentaire. Les données spécialisées n’effaçaient pas les caractéristiques du système sous-jacent.
Cette conclusion renforce l’argument en faveur d’évaluations répétées. Un modèle médical ne peut pas hériter d’une approbation permanente à partir d’une seule version réussie. Modifier le socle, le processus d’entraînement, le système de récupération ou le prompt peut changer son comportement.
L’évaluation ultérieure a également testé quatre scénarios administratifs. Ils comprenaient le mappage de codes de laboratoire, la préparation de registres d’AVC, la rédaction de résumés de sortie et les requêtes en langage naturel sur les dossiers médicaux électroniques.
Les noms de laboratoire ont été mappés vers des codes JLAC11 avec une précision atteignant 80,3 % à partir de données de trois établissements médicaux. JLAC11 est un système japonais de codification des analyses de laboratoire.
Pour l’organisation des registres d’AVC, le modèle a enregistré une précision de 92,2 %. Le projet a comparé ce résultat à une précision humaine de 94 à 95 %.
Neuf spécialistes ont évalué des projets de résumés de sortie. Le modèle adapté a obtenu un score moyen de 4,748 sur cinq, que le projet a décrit comme comparable à sa référence commerciale.
Ces résultats sont plus informatifs qu’un unique score d’examen, car ils mettent en évidence des coûts d’erreur différents. Un code incorrect, un détail omis dans un registre et un résumé trompeur créent des risques distincts. Chaque flux de travail nécessite son propre processus de révision.
Les tests provenaient toujours des participants au projet. Une réplication indépendante, des distributions détaillées des erreurs et des résultats hospitaliers longitudinaux rendraient les preuves plus convaincantes. La précision moyenne seule ne peut pas révéler quels patients ou quelles spécialités reçoivent les résultats les plus faibles.
Le programme ultérieur a également maintenu une frontière claire. Ses usages déclarés soutenaient la documentation et le travail administratif, tandis que les médecins et autres professionnels conservaient le jugement final. Les modèles ne diagnostiquaient ni ne traitaient les patients.
Il ne s’agit pas d’un recul par rapport à l’ambition initiale. C’est une séquence de déploiement plus crédible. L’assistance administrative offre des bénéfices mesurables tout en préservant un point de décision humain clair.
La concurrence oppose contrôle national et commodité des plateformes
Le principal défi de Sakura est de prouver que le contrôle national peut devenir un service durable plutôt qu’un avantage de recherche temporaire.
Une organisation de santé peut déjà expérimenter avec des modèles mondiaux performants. Ces services proposent des API familières, une documentation étendue et des cycles de produits rapides. Certains prennent en charge des contrôles d’entreprise et des options de traitement régional.
Sakura doit offrir une raison de choisir une plateforme plus petite. L’hébergement au Japon en est une, surtout lorsque les institutions veulent exercer un contrôle clair sur l’emplacement des données. Des modèles spécialisés et des relations avec la recherche locale en ajoutent une autre.
Pourtant, la souveraineté n’est pas binaire. Un modèle peut fonctionner au Japon tout en dépendant d’un socle créé ailleurs. Weblab-MedLLM-Qwen-2.5-109B-Instruct utilisait Qwen 2.5, une famille de modèles développée par Alibaba.
Le projet combinait donc un socle d’origine étrangère avec un entraînement, une évaluation, des capacités de calcul et un hébergement japonais. Cette architecture offre davantage de contrôle opérationnel sans prétendre que chaque couche est d’origine nationale.
Les recherches ultérieures ont également exploré des modèles japonais entièrement entraînés. Ces systèmes restaient en retrait des modèles adaptés les plus performants dans les performances rapportées. La comparaison montre la tension entre indépendance technologique et capacité immédiate.
Construire localement chaque couche peut accroître le contrôle et les connaissances de recherche. Adapter un modèle ouvert établi peut permettre d’atteindre plus vite des performances utiles. Le programme japonais d’IA médicale teste les deux voies plutôt que de prétendre que ce compromis a disparu.
La viabilité commerciale soulève une autre question. L’essai de mars était gratuit et temporaire, tandis que l’AI Engine sous-jacent fonctionne comme une plateforme facturée à l’usage. Sakura n’a pas décrit publiquement d’offre permanente de modèle médical dans les documents cités.
Les hôpitaux ont besoin de plus qu’un endpoint. Ils ont besoin de conditions d’achat, de fiabilité du service, d’examens de sécurité, de contrôles d’accès, de journalisation, de gestion des incidents, de notifications de changement de modèle et d’intégration avec les dossiers existants.
Ils ont également besoin d’une évaluation stable. Un modèle hébergé qui change sans préavis peut invalider les tests antérieurs d’un hôpital. Un déploiement versionné et une documentation des changements compteront autant que les performances mises en avant.
L’intégration constitue son propre obstacle. Les hôpitaux japonais utilisent des terminologies, codes, structures de dossiers et pratiques opérationnelles différents. Le même modèle peut produire des résultats différents lorsqu’il est relié à des environnements de données différents.
Cette diversité explique l’importance des tests multi-institutionnels. Un résultat issu du jeu de données de recherche propre d’un hôpital peut ne pas être transférable aux dossiers historiques d’un autre établissement. L’adaptation locale peut améliorer l’adéquation, mais aussi créer de nouvelles questions de sécurité.
La réponse concurrentielle des fournisseurs mondiaux ne restera pas immobile. Leurs modèles s’amélioreront et les contrôles d’entreprise s’étendront. Sakura ne peut pas s’appuyer sur une avance dans un benchmark obtenue face à des systèmes plus anciens.
Sa position la plus défendable repose sur l’infrastructure et la validation locale. L’entreprise peut prendre en charge l’entraînement à grande échelle, héberger les modèles au niveau national et travailler avec les institutions sur les flux de travail japonais. Cet ensemble est plus difficile à réduire à un classement.
L’entreprise doit encore montrer que cet ensemble réduit les frictions opérationnelles réelles. Un modèle qui approche la précision humaine pour les registres est prometteur. Un système déployé qui fait gagner du temps au personnel sans accroître les erreurs constituerait une preuve plus solide.
La pression s’exerce donc autant sur Sakura que sur les fournisseurs mondiaux. Elle doit transformer un programme de recherche soutenu à l’échelle nationale en services reproductibles. Sinon, le projet restera une démonstration impressionnante que les acheteurs de soins de santé ne peuvent pas adopter de façon habituelle.
Trois signaux détermineront la suite
Un accès renouvelé, une validation dans plusieurs hôpitaux et un service de production défini montreront si le LLM médical de Sakura Internet dépasse le cadre de la recherche.
Le premier signal est un nouveau plan d’accès. L’essai interactif annoncé a pris fin le 31 août 2026. Un endpoint de recherche renouvelé, un accès API documenté ou un référencement permanent du modèle montreraient que l’évaluation externe peut se poursuivre.
L’accès devrait inclure des conditions claires concernant les données et des informations sur la version du modèle. Les chercheurs doivent savoir si les prompts sont conservés, si les sorties peuvent soutenir un entraînement ultérieur et à quel moment le modèle sous-jacent change.
L’absence d’un accès renouvelé affaiblirait le récit plus large de la plateforme. Elle suggérerait que le lancement de mars était une étude à durée déterminée plutôt que le début d’un service d’IA médicale durable.
Le deuxième signal est l’existence de preuves indépendantes et multi-hospitalières. Le programme a déjà testé plusieurs tâches administratives et utilisé les données de trois établissements pour le mappage des codes de laboratoire. Une réplication plus large devrait révéler l’évolution des performances selon les systèmes de dossiers et les spécialités.
Les rapports les plus utiles décriront les catégories d’erreurs, et pas seulement les moyennes. Ils devraient montrer où un système échoue, comment les réviseurs détectent les erreurs et s’il fait gagner du temps après vérification.
Des preuves issues de l’exploitation courante renforceraient considérablement le dossier. Une étude prospective peut mesurer ce qui se passe lorsque le personnel utilise les sorties du modèle sous une pression réelle de charge de travail. Les benchmarks historiques ne peuvent pas reproduire toutes les dimensions de cet environnement.
Le troisième signal est une frontière de production. Sakura et ses partenaires doivent définir quelles tâches un système commercial prend en charge, qui peut l’utiliser et quelle approbation humaine demeure obligatoire.
Un service crédible divulguerait également ses pratiques de surveillance et de mise à jour. Les hôpitaux doivent savoir comment les performances sont contrôlées après le déploiement et comment les incidents affectent les autres clients.
Ces signaux comptent au-delà du Japon. Les gouvernements et les industries réglementées veulent de plus en plus davantage de contrôle sur les modèles, l’infrastructure et l’emplacement des données. Le projet Sakura offre un test concret de la possibilité de faire coexister ce contrôle avec des performances compétitives.
Pour les développeurs, la leçon consiste à traiter l’hébergement, le comportement du modèle et la politique applicative comme des couches distinctes. Un endpoint national sécurisé ne rend pas tous les usages sûrs. Un benchmark solide ne résout pas le risque lié au flux de travail.
Pour les acheteurs du secteur de la santé, la prochaine question est pratique : ce LLM médical japonais peut-il réduire une charge administrative définie sous une supervision mesurable ? Ce test, et non une nouvelle victoire dans un classement, déterminera si la plateforme de recherche de Sakura devient une infrastructure clinique durable.



