Seul profil au déterminisme prouvé (dense batch-invariant) + emit garanti par grammaire contrainte + auto-hébergeable. Compromis : capacité brute sous les très gros MoE, à valider sur charge réelle.
Classement LLM « ARI Friendly »
Classement comparatif Logrobot des modèles d'IA selon leur aptitude à faire tourner un assistant de diagnostic agentique : sorties reproductibles (déterminisme), appel d'outils / emit JSON fiable, auto-hébergement pour la confidentialité, latence et coût. Le critère décisif n'est pas le quota gratuit mais le déterminisme : un diagnostic doit être reproductible d'un run à l'autre.
Mis à jour le 2026-07-09.
Tier S — agent-ready
Débit maximal (Cerebras/Groq) + tool-calling solide + licence Apache auto-hébergeable. Compromis : MoE → déterminisme bit-exact non démontré, on-prem = 2×H100.
Tier A — très bons
Meilleur rapport VRAM/vitesse on-prem (16 GB Q4), dense + emit contraignable. Compromis : déterminisme estimé (non validé), conservateur sur appels chaînés.
Déterminisme dense validé (SGLang) + ~97% d'appels bien formés + on-prem US. Compromis : lent sur longues boucles, modèle vieillissant (déc-2024).
Vitesse/coût imbattables (Groq), on-prem trivial. Compromis : 20B → raisonnement multi-tours + emit complexe fragiles ; réserver au routage/tours simples.
Meilleur duo coût + confidentialité (UE/RGPD, 1 GPU, seed). Compromis : tool-calling best-effort → emit à verrouiller (grammaire/validateur).
Emit « code-shaped » bien géré (~96% tool-work) + on-prem léger. Compromis : plus faible hors tâches code, MoE → déterminisme estimé.
Chaîne de raisonnement explicite utile au diagnostic + on-prem UE. Compromis : le reasoning gonfle les tokens → latence et coût en hausse.
Raisonnement le plus capable des open-weights + tool-calling top (BFCL-v3) + on-prem. Compromis : MoE 235B → déterminisme faible + multi-GPU lourd.
Tier B — avec réserve
Licence MIT auto-hébergeable : règle la confidentialité + emit contraint. Compromis : MoE 355B → déterminisme non prouvé + matériel multi-GPU lourd.
Meilleure fiabilité d'emit du marché (Structured Outputs, grammaire compilée). Compromis : cloud US non auto-hébergeable → à exclure sur données confidentielles.
Structured Outputs strict = 100% conformité schéma. Compromis : cloud US + seed best-effort (fingerprint tournant) → déterminisme non garanti.
responseSchema (constrained decoding) fiable. Compromis : seed buggé (sorties variables à seed fixe) + cloud → déterminisme faible.
Tier C — déconseillés (boucle agent)
Coût API imbattable (MIT). Compromis : 671B → on-prem irréaliste (donc API CN) + emit strict buggé + déterminisme MoE faible.
Agentique/tool-calling réputés très forts. Compromis : 1T → on-prem irréaliste (donc API CN) + déterminisme très faible.
Quick-win latence (débit Cerebras, mêmes prompts). Compromis : ne règle ni le déterminisme ni la confidentialité (reste cloud, MoE, sans seed fiable).
Cumule les causes de non-déterminisme + cloud CN + latence 40-60 s + bugs emit. À réserver au test, à remplacer pour tout usage déterministe ou confidentiel.
Critère décisif : le déterminisme (un diagnostic doit être reproductible d'un run à l'autre), puis l'appel d'outils / emit JSON fiable et l'auto-hébergement pour la confidentialité. Le déterminisme est une propriété du stack (moteur batch-invariant + grammaire contrainte), pas seulement des poids ; les scores des architectures MoE restent estimés. Évaluation comparative Logrobot, repères datés janvier 2026.