Comparateur de modèles open-weight
Quels LLM open-weight peuvent réellement tourner sur cette machine ?
Indiquez votre GPU ou votre Mac et obtenez un classement: modèles compatibles, quantification utilisable, vitesse de génération, scores généraux et code, et conditions de licence pour un usage produit.
- 119
- modèles suivis
- 0
- compatibles avec un usage commercial
- 40
- éditeurs
- 2026-08-22
- dernière mise à jour
Comment le classement est calculé
Chaque chiffre de cette page est dérivé de la structure publiée des modèles et des spécifications matérielles publiques. Vous pouvez donc le recalculer à la main. Aucun score n'est ajusté sur des benchmarks privés et aucune promesse fournisseur n'est reprise telle quelle.
Modèle mémoire et vitesse
Poids
octets = paramètres x bits_par_poids / 8Les bits par poids incluent les échelles par bloc des k-quants; Q4_K_M est donc compté à 4,85 bits plutôt qu'à 4.
Cache KV
octets = 2 x couches x tetes_kv x dim_tete x contexte x octets_par_elementLe calcul lit le config.json propre à chaque modèle, ce qui tient compte des architectures avec grouped-query attention ou latent attention.
Overhead runtime
octets = plancher_moteur + part_moteur x poidsBuffers d'allocation, d'activation et de capture de graphe. Ce plancher dépend du moteur et peut fortement déplacer la compatibilité réelle.
Mémoire utilisable
budget = capacité x part_plateformeLes GPU discrets donnent environ 92% de leur VRAM au runtime. Apple Silicon limite la mémoire GPU câblée autour de 75% de la mémoire unifiée.
Débit de décodage
tokens/s = min(bande_passante / (poids_actifs + 1/2 x cache_kv) x efficacité, plafond)Le décodage local est généralement limité par la bande passante mémoire. Les MoE ne lisent que leurs experts actifs par token, mais tous les paramètres doivent rester résidents.
Le classement
L'ordre par défaut part de la capacité mesurée, la réduit selon la perte liée à la quantification, puis applique le débit comme modificateur. Au-delà d'environ trente tokens par seconde, davantage de débit change peu l'expérience; la vitesse ne modifie fortement le classement que lorsqu'un modèle devient peu pratique. Un modèle qui ne tient qu'en streamant des experts depuis la RAM système est classé derrière un modèle entièrement résident en mémoire accélérateur.
Le score général reprend l'Intelligence Index d'Artificial Analysis. Le score code est la moyenne des évaluations de code disponibles pour le modèle - SciCode, LiveCodeBench-Repo, Terminal-Bench Hard et LiveCodeBench - et chaque composant est affiché dans le détail du modèle.
Les poids en pleine précision sont exclus de la recherche automatique de quantification. En pratique, le 8 bits est quasiment indistinguable de la précision native; servir du BF16 localement coûte donc deux fois plus de mémoire et divise le débit sans gain mesurable.
Le moteur d'inférence
Ce que le moteur change. Trois points changent la réponse: les formats de quantification chargeables, le débit réellement atteint par la boucle de décodage, et la mémoire prise par le processus avant même de charger les poids. Par exemple, llama.cpp lit les k-quants GGUF, vLLM lit AWQ, GPTQ, FP8 et INT8, ExLlamaV2 lit EXL2, et MLX utilise son format group-quantized.
L'offload dépend du moteur. Un grand modèle MoE qui dépasse la VRAM peut encore tourner si les experts routés restent en RAM système et sont streamés token par token. llama.cpp et Ollama le permettent; vLLM et ExLlamaV2 attendent plutôt un modèle résident. Le même modèle peut donc être marqué comme nécessitant de l'offload avec un runtime et comme incompatible avec un autre.
Ce sont des ratios, pas des mesures. Les facteurs d'efficacité sont ancrés sur les valeurs documentées par llmfit pour llama.cpp et ajustés relativement au design publié de chaque moteur. Ils servent à comparer les runtimes sur une même machine, pas à remplacer un benchmark d'une build précise.
Ce que le navigateur ne peut pas connaître
Aucune API web ne remonte la VRAM, la RAM installée ou la bande passante mémoire. La détection automatique lit l'adaptateur WebGPU, le nombre de coeurs CPU et un indice mémoire volontairement limité, puis propose le preset le plus proche avec un niveau de confiance. Confirmez ou corrigez les champs.
Sources
Référentiel canonique, balises de licence, accès restreint, téléchargements et paramètres d'architecture dans chaque config.json: nombre de couches, têtes KV et dimension de tête.
Intelligence Index, Agentic Index, évaluations de code, nombre de paramètres, paramètres actifs, fenêtres de contexte, licences et classification d'usage commercial.
Approche de compatibilité matérielle suivie ici: évaluer les modèles selon mémoire, débit, qualité et contexte, puis estimer la vitesse à partir de la bande passante mémoire.
Le catalogue a été lu depuis ces sources le 2026-08-22. Les résumés de licence sont indicatifs et ne constituent pas un avis juridique; chaque modèle pointe vers son texte de licence.
Questions fréquentes
Combien de VRAM faut-il pour exécuter un LLM open-weight localement ?
Il faut compter le nombre de paramètres multiplié par les bits par poids, divisé par huit, puis ajouter le cache KV et environ un gigaoctet d'overhead runtime. Le cache KV explique pourquoi le nombre de paramètres seul prédit mal la compatibilité.
Quelle quantification choisir ?
Q4_K_M est généralement le meilleur compromis: il conserve une grande partie des capacités du modèle avec moins d'un tiers de la mémoire de la précision native. Q6_K et Q8_0 sont quasi sans perte si vous avez la marge.
Quel LLM local est le meilleur pour le code ?
Cela dépend de ce qui tient sur votre matériel, pas d'une réponse universelle. La spécialisation Code de cette page trie le catalogue selon la moyenne des évaluations de code du modèle - SciCode, LiveCodeBench-Repo, Terminal-Bench Hard et LiveCodeBench - après application de vos filtres VRAM, quantification et contexte, afin que le premier résultat soit un modèle que vous pouvez réellement exécuter, pas simplement le mieux noté du catalogue dans l'absolu.
Peut-on exécuter un LLM de code en local ?
Oui, et le code est l'une des tâches les plus tolérantes pour les modèles locaux: le codage agentique profite surtout d'un contexte long et d'une faible latence, plus que du meilleur score d'un classement. Un modèle quantifié de la classe 30B sur un GPU de 24 Go couvre bien la plupart des tâches de code quotidiennes sous llama.cpp ou vLLM; des modèles quantifiés plus petits (7-14B) suffisent pour l'autocomplétion et l'édition d'un seul fichier avec 8 à 16 Go de VRAM. Sélectionnez la spécialisation Code ci-dessus pour filtrer le catalogue selon ce qui tient sur votre machine.
Puis-je utiliser ces modèles open-weight commercialement ?
Souvent, mais pas toujours. Apache 2.0 et MIT autorisent un déploiement commercial avec obligations d'attribution. Certaines licences communautaires ou fournisseurs ajoutent des seuils, restrictions ou usages interdits.
Un modèle mixture-of-experts demande-t-il moins de mémoire ?
Non. Un MoE doit garder tous ses paramètres en mémoire, car chaque token peut router vers différents experts. Il économise surtout de la bande passante: seuls les experts actifs sont lus par token.
Les estimations en tokens par seconde sont-elles précises ?
Ce sont des estimations issues d'un modèle de bande passante, pas des mesures. Elles servent à comparer les modèles sur une même machine; le débit réel dépend du runtime, du batch, de la longueur de prompt et des limites thermiques.
Pourquoi exécuter un modèle local plutôt qu'appeler une API ?
Parce que certaines données ne peuvent pas sortir du réseau. Les exigences, procédures de test ou sources confidentielles peuvent être analysés localement sans franchir de frontière organisationnelle.
À quel point ce catalogue est-il à jour ?
Il est régénéré chaque jour à partir de Hugging Face et Artificial Analysis plutôt que maintenu à la main. Les sorties open-weight évoluent vite; un modèle en tête aujourd'hui peut être remplacé en quelques semaines.
Exécutez la vérification et la validation sur votre propre infrastructure
KomAInu est une solution d'IA on-premise pour la vérification DO-178C, ISO 26262 et IEC 62304. Indépendante du modèle, elle tourne sur vos serveurs avec les modèles open-weight de votre choix. Exigences, procédures de test et code source ne quittent jamais votre réseau.
Filtrez le catalogue par juridiction d'éditeur quand vos règles d'achat, de contrôle des exportations ou de résidence des données limitent les poids hébergeables. Europe, France et autres régions restent des filtres et un tri optionnel, jamais un biais caché dans Recommandé.