88,4 % mesurés sur les 40 cas, aux barèmes officiels 2026 de chaque fournisseur
Le laboratoire
LES CHIFFRES DE LA MAISON SE VÉRIFIENT.
Pas de « −95 % » sorti d'un chapeau. Un corpus public de 40 cas réels, une vérité terrain, et un juge indépendant qui note ce que le modèle perd vraiment. Voici les mesures — brutes.

juge vision indépendant, information réellement préservée
un seul cas sous 90 % (perspective forte, jugé 85 %, non critique)
le % affiché colle au juge — souvent prudent
DEUX JUGES VALENT MIEUX QU'UN
Fidélité directe
Le juge reçoit l'image originale et la sortie optimisée, et note l'information perdue. La métrique principale.
- fidélité moyenne96,5 %
- cas ≥ 95 %37 / 40
- cas critiques signalés1
Équivalence de réponse
Un second regard : même question posée au modèle sur l'image brute puis sur la sortie — les réponses concordent-elles ? Mesuré sur les 34 premiers cas du corpus (les 6 cas durs ajoutés depuis n'ont été passés qu'au juge de fidélité).
- équivalence moyenne96,9 %
- cas ≥ 95 %29 / 34
- cas basgraphiques / dashboards
CE QUI COMPTE : SAVOIR QUAND NE PAS OPTIMISER
Un graphique, un tableau de bord, une UI dense : l'information y est spatiale. La convertir en texte à plat la trahirait. Le routeur le détecte — il relit sa propre sortie (rétention mesurée) et, au moindre doute, garde l'image. Les rares cas bas de nos mesures sont exactement ceux-là : le gate fait son travail, il ne casse pas ce qu'il ne sait pas réduire.
VÉRIFIABLE, PAS CROYABLE
Corpus public
40 captures réelles + leur vérité terrain, régénérables à l'identique (déterministe).
Juge indépendant
Mistral (gratuit), Gemini ou Claude — au choix. Le moteur ne se note pas lui-même.
Tout est dans le repo
bench/ : générer les payloads, lancer le juge, lire le rapport. Reproduisez nos chiffres.
Continuer la visite