Classement LLM « ARI Friendly »

Classement comparatif Logrobot des modèles d'IA selon leur aptitude à faire tourner un assistant de diagnostic agentique : sorties reproductibles (déterminisme), appel d'outils / emit JSON fiable, auto-hébergement pour la confidentialité, latence et coût. Le critère décisif n'est pas le quota gratuit mais le déterminisme : un diagnostic doit être reproductible d'un run à l'autre.

Mis à jour le 2026-07-09.

Tier S — agent-ready

Qwen3-32B (dense)Alibaba (open)

Seul profil au déterminisme prouvé (dense batch-invariant) + emit garanti par grammaire contrainte + auto-hébergeable. Compromis : capacité brute sous les très gros MoE, à valider sur charge réelle.

Déterminisme : ProuvéOutils : OuiRaisonnement : BonOn-premTrès rapide
Self-host
gpt-oss-120BOpenAI (Apache-2.0)

Débit maximal (Cerebras/Groq) + tool-calling solide + licence Apache auto-hébergeable. Compromis : MoE → déterminisme bit-exact non démontré, on-prem = 2×H100.

Déterminisme : Estimé (MoE)Outils : OuiRaisonnement : BonOn-prem USTrès rapide
Self-host

Tier A — très bons

Gemma 4 27BGoogle (open)

Meilleur rapport VRAM/vitesse on-prem (16 GB Q4), dense + emit contraignable. Compromis : déterminisme estimé (non validé), conservateur sur appels chaînés.

Déterminisme : EstiméOutils : OuiRaisonnement : BonOn-prem USRapide
Self-host
Llama 3.3 70BMeta (open)

Déterminisme dense validé (SGLang) + ~97% d'appels bien formés + on-prem US. Compromis : lent sur longues boucles, modèle vieillissant (déc-2024).

Déterminisme : ValidéOutils : OuiRaisonnement : BonOn-prem USRapide
Self-host
gpt-oss-20BOpenAI (Apache-2.0)

Vitesse/coût imbattables (Groq), on-prem trivial. Compromis : 20B → raisonnement multi-tours + emit complexe fragiles ; réserver au routage/tours simples.

Déterminisme : EstiméOutils : PartielRaisonnement : MoyenOn-prem USTrès rapide
Self-host
Mistral Small 3.2 24BMistral (UE, Apache-2.0)

Meilleur duo coût + confidentialité (UE/RGPD, 1 GPU, seed). Compromis : tool-calling best-effort → emit à verrouiller (grammaire/validateur).

Déterminisme : EstiméOutils : PartielRaisonnement : BonOn-prem UERapide
Self-host
Qwen3-Coder 30BAlibaba (open)

Emit « code-shaped » bien géré (~96% tool-work) + on-prem léger. Compromis : plus faible hors tâches code, MoE → déterminisme estimé.

Déterminisme : EstiméOutils : OuiRaisonnement : BonOn-premRapide
Self-host
Magistral Small 1.2Mistral (UE)

Chaîne de raisonnement explicite utile au diagnostic + on-prem UE. Compromis : le reasoning gonfle les tokens → latence et coût en hausse.

Déterminisme : EstiméOutils : PartielRaisonnement : ÉlevéOn-prem UEMoyen
Self-host
Qwen3-235B-A22BAlibaba (open)

Raisonnement le plus capable des open-weights + tool-calling top (BFCL-v3) + on-prem. Compromis : MoE 235B → déterminisme faible + multi-GPU lourd.

Déterminisme : Faible (MoE)Outils : OuiRaisonnement : ÉlevéOn-premRapide
Self-host

Tier B — avec réserve

GLM-4.6 / 4.7 (auto-hébergé)Zhipu (MIT)

Licence MIT auto-hébergeable : règle la confidentialité + emit contraint. Compromis : MoE 355B → déterminisme non prouvé + matériel multi-GPU lourd.

Déterminisme : EstiméOutils : PartielRaisonnement : BonOn-premRapide
Self-host
Claude 4.x (Sonnet 4.5 / Haiku 4.5)Anthropic

Meilleure fiabilité d'emit du marché (Structured Outputs, grammaire compilée). Compromis : cloud US non auto-hébergeable → à exclure sur données confidentielles.

Déterminisme : Best-effortOutils : OuiRaisonnement : ÉlevéCloud USMoyen
Cloud
GPT-5 / GPT-4.1OpenAI

Structured Outputs strict = 100% conformité schéma. Compromis : cloud US + seed best-effort (fingerprint tournant) → déterminisme non garanti.

Déterminisme : Best-effortOutils : OuiRaisonnement : ÉlevéCloud USMoyen
Cloud
Gemini 2.5 / 3Google

responseSchema (constrained decoding) fiable. Compromis : seed buggé (sorties variables à seed fixe) + cloud → déterminisme faible.

Déterminisme : Faible (seed buggé)Outils : OuiRaisonnement : BonCloud USRapide
Cloud

Tier C — déconseillés (boucle agent)

DeepSeek V3.2DeepSeek (MIT)

Coût API imbattable (MIT). Compromis : 671B → on-prem irréaliste (donc API CN) + emit strict buggé + déterminisme MoE faible.

Déterminisme : FaibleOutils : PartielRaisonnement : BonCloud CN / on-prem 671BMoyen
Self-host
Kimi K2Moonshot (MIT modifié)

Agentique/tool-calling réputés très forts. Compromis : 1T → on-prem irréaliste (donc API CN) + déterminisme très faible.

Déterminisme : Très faibleOutils : OuiRaisonnement : ÉlevéCloud CN / on-prem 1TRapide
Self-host
GLM-4.7 × CerebrasZhipu / Cerebras

Quick-win latence (débit Cerebras, mêmes prompts). Compromis : ne règle ni le déterminisme ni la confidentialité (reste cloud, MoE, sans seed fiable).

Déterminisme : Très faibleOutils : PartielRaisonnement : BonCloudTrès rapide
Cloud
GLM-4.7 (Z.ai)Zhipu / Z.ai

Cumule les causes de non-déterminisme + cloud CN + latence 40-60 s + bugs emit. À réserver au test, à remplacer pour tout usage déterministe ou confidentiel.

Déterminisme : Très faibleOutils : PartielRaisonnement : BonCloud CNLent
Cloud

Critère décisif : le déterminisme (un diagnostic doit être reproductible d'un run à l'autre), puis l'appel d'outils / emit JSON fiable et l'auto-hébergement pour la confidentialité. Le déterminisme est une propriété du stack (moteur batch-invariant + grammaire contrainte), pas seulement des poids ; les scores des architectures MoE restent estimés. Évaluation comparative Logrobot, repères datés janvier 2026.