← La droguerie

Le laboratoire

LES CHIFFRES DE LA MAISON SE VÉRIFIENT.

Pas de « −95 % » sorti d'un chapeau. Un corpus public de 40 cas réels, une vérité terrain, et un juge indépendant qui note ce que le modèle perd vraiment. Voici les mesures — brutes.

Une balance : l'image lourde d'un côté, le ticket léger de l'autre
−0 %
tokens retirés

88,4 % mesurés sur les 40 cas, aux barèmes officiels 2026 de chaque fournisseur

0,0 %
fidélité jugée

juge vision indépendant, information réellement préservée

0 / 40
cas ≥ 95 %

un seul cas sous 90 % (perspective forte, jugé 85 %, non critique)

0,0 pt
écart auto-estimé / juge

le % affiché colle au juge — souvent prudent

DEUX JUGES VALENT MIEUX QU'UN

Fidélité directe

Le juge reçoit l'image originale et la sortie optimisée, et note l'information perdue. La métrique principale.

  • fidélité moyenne96,5 %
  • cas ≥ 95 %37 / 40
  • cas critiques signalés1

Équivalence de réponse

Un second regard : même question posée au modèle sur l'image brute puis sur la sortie — les réponses concordent-elles ? Mesuré sur les 34 premiers cas du corpus (les 6 cas durs ajoutés depuis n'ont été passés qu'au juge de fidélité).

  • équivalence moyenne96,9 %
  • cas ≥ 95 %29 / 34
  • cas basgraphiques / dashboards

CE QUI COMPTE : SAVOIR QUAND NE PAS OPTIMISER

Un graphique, un tableau de bord, une UI dense : l'information y est spatiale. La convertir en texte à plat la trahirait. Le routeur le détecte — il relit sa propre sortie (rétention mesurée) et, au moindre doute, garde l'image. Les rares cas bas de nos mesures sont exactement ceux-là : le gate fait son travail, il ne casse pas ce qu'il ne sait pas réduire.

VÉRIFIABLE, PAS CROYABLE

Corpus public

40 captures réelles + leur vérité terrain, régénérables à l'identique (déterministe).

Juge indépendant

Mistral (gratuit), Gemini ou Claude — au choix. Le moteur ne se note pas lui-même.

Tout est dans le repo

bench/ : générer les payloads, lancer le juge, lire le rapport. Reproduisez nos chiffres.

Continuer la visite