← farfadet.ai
Méthodologie

D'où viennent nos chiffres.

Un produit qui vend l'honnêteté doit montrer ses calculs. Voici comment Farfadet route, estime l'énergie, et ce que nos chiffres veulent dire — formules, sources, et limites assumées.

1. Le routage : trois questions par requête

Pour chaque question, Farfadet calcule un score par modèle candidat, pondéré ainsi : performance 40 % (le modèle est-il assez capable pour cette complexité ?), sobriété 40 % (son énergie estimée par requête), coût 20 % (son prix par jeton).

La souveraineté n'entre pas dans le score : c'est un filtre — en mode souverain, les modèles hors UE/local ne participent même pas au calcul. Le carbone, lui, est compté une seule fois, dans l'axe sobriété : l'énergie estimée du modèle est convertie en équivalent-carbone selon l'intensité électrique de sa zone (l'électricité française comme référence — un modèle sur réseau très carboné paie sa zone, dans cet axe et nulle part ailleurs). Une organisation peut, par sa politique, déclarer en plus une préférence explicite pour les zones souveraines : un choix de gouvernance affiché, neutre par défaut.

sobriété = 1 / log(Wh éq-carbone × 100 + 1) — pénalise les gros modèles et les zones à électricité carbonée ; les modèles « raisonneurs » comptent ×2,5 (ils génèrent beaucoup plus de jetons).
coût = 1 / √(prix) — favorise les modèles économiques sans écraser la qualité (plafonné à 1).

Correction du 7 août 2026 — en auditant notre propre code, nous avons trouvé deux écarts avec cette page : le carbone de zone était appliqué en multiplicateur du score entier (il dégradait donc aussi les axes performance et coût — un double comptage), et un bonus souveraineté était actif par défaut, en contradiction avec « agnostique par défaut ». Les deux sont corrigés ; l'évaluation complète a été rejouée après correction : métriques inchangées (souveraineté 100 %, right-sizing 100 %, −45 %). Nous documentons nos erreurs plutôt que de les réécrire.

Des contraintes dures peuvent s'ajouter (plancher de qualité, budget de latence) : les modèles qui ne les respectent pas sont écartés avant le scoring — une approche d'« ensemble faisable » inspirée des travaux de routage sous contraintes (GAR — Green-Aware Routing). La complexité de la question est estimée par une heuristique déterministe (longueur, code, nombre de questions, vocabulaire) — jamais par un LLM : le routage est explicable ligne à ligne. Mesuré sur notre corpus d'évaluation, il prend de l'ordre de 0,1 ms (0,06 à 0,10 ms selon la machine) — notre seuil d'acceptation était fixé à 50 ms.

2. L'énergie : des estimations, pas des mesures fournisseur

Aucun grand fournisseur ne publie l'énergie réelle de ses modèles. Nous utilisons donc des estimations documentées, à deux profils par modèle :

ContexteSourceOrdre de grandeur
Modèle local (GPU personnel)benchmarks académiques de consommation par jeton sur GPU grand public (Ren et al., 2024)≈ 1–25 Wh / 1 000 jetons
Cloud hyperscalecalibration ImpactLLM (Pachot & Petit, 2026), ancrée sur ≈ 0,24 Wh médian mesuré à l'échelle Google (Elsworth et al., 2025) ; outillage EcoLogits≈ 0,02–2 Wh / 1 000 jetons

Honnêteté carbone : un modèle local sur votre GPU consomme plus par requête qu'un datacenter optimisé (souvent 50–200×). Le local se justifie par la souveraineté, jamais par le carbone — et Farfadet affiche toujours cette réalité, pas une fable verte.

Dans la même famille de travaux, et qui nourrissent notre approche sans que nous en reprenions les chiffres : Boavizta (méthodes et outils libres sur l'empreinte du numérique) et Carbone 4 (méthodologie carbone).

Le CO₂ est ensuite calculé avec l'intensité électrique de la zone du modèle (valeurs statiques aujourd'hui : France ≈ 59 gCO₂/kWh, États-Unis ≈ 396, Chine ≈ 540 — le temps réel via les données de réseau est sur la feuille de route).

3. Le « −45 % » : ce qu'il veut dire exactement

D'où vient ce corpus : il est le nôtre. Cinquante prompts français que nous avons écrits et annotés à la main — salutations, questions factuelles, rédaction, code, analyse experte — versionnés avec le produit (apps/api/eval/corpus.ts) et rejoués à chaque modification du routeur. Ce n'est pas un jeu de test public : nous le publions pour qu'il soit critiquable, pas pour qu'il fasse autorité. Dernière exécution : 7 août 2026 — mêmes résultats que l'évaluation initiale du 2 juillet.

Sur ce corpus de 50 requêtes françaises annotées (du trivial à l'expert), nous comparons l'énergie estimée des modèles choisis par le routeur à un scénario où chaque requête irait au modèle premium de référence. Résultat : −45 % d'énergie estimée, avec 100 % de conformité souveraineté et zéro modèle premium sur les tâches légères.

Traduit en CO₂, le même corpus donne −92 % (mesure du 7 août 2026) : s'ajoute à l'économie d'énergie l'effet de zone — les modèles routés tournent surtout en France/UE (≈ 59 gCO₂/kWh) quand le premium de référence tourne aux États-Unis (≈ 396). Deux chiffres, deux causes, publiés séparément : −45 % vient du choix du modèle, le reste vient de où il tourne. À titre de comparaison, GAR obtient −74 % de CO₂ avec du géo-routage temps réel — nos intensités sont statiques : le temps réel est un levier encore devant nous, pas déjà compté.

3 bis. Les leviers encore devant — et leurs études

Le −45 % ne mesure qu'un levier de frugalité : choisir le bon modèle. La littérature en documente d'autres, que nous n'avons pas encore construits — chacun, s'il est livré, aura sa mesure publiée ici, avec sa méthode et sa date :

Ces chiffres appartiennent à leurs auteurs, sur leurs benchmarks et leurs baselines — ils ne s'additionnent pas entre eux, et nous ne les revendiquons pas : ils justifient la direction, pas nos résultats.

4. La souveraineté : trois niveaux, pas un label

Pour chaque modèle, Farfadet distingue : la juridiction du fournisseur (fait vérifiable), l'exposition extraterritoriale (un fournisseur américain reste soumis au Cloud Act, même en « région européenne »), et la résidence réelle des données (vérifiable seulement en local). Le score de session agrège ces niveaux — et un seul octet parti hors UE dégrade la note. En parallèle, vos données personnelles sont masquées dans votre navigateur avant tout envoi : le serveur ne voit que des jetons (⟦NOM_1⟧), quel que soit le modèle.

5. Limites assumées

Une remarque, une correction, une meilleure source ? Cette page décrit des estimations, pas des vérités : si vous voyez une erreur de méthode, un chiffre dépassé ou une hypothèse contestable, écrivez-nous — contact@proximind.fr. Nous corrigerons, et nous le daterons.

Dernière mise à jour : 7 août 2026 · Formules vérifiées contre le code du routeur (eco-methodology-2026-08-07) ; chiffres issus de l'évaluation rejouée le 7 août 2026. Les formules et corpus sont versionnés avec le produit. Question, correction ? contact@proximind.fr

← Retour à farfadet.ai