Capacités des modèles

Comparez les modèles selon huit dimensions, de l’intelligence au coût d’utilisation et à la réactivité.

01

Intelligence globale

Comparez les capacités globales en raisonnement, programmation et travail intellectuel.

© Artificial Analysis · 2026-09-27Intelligence Index v4.3.2
Plus élevé est préférable. L’indice combine 10 évaluations : c’est un score comparatif, pas un taux de réussite.

Lecture du graphique

Dans cette sélection, Opus 5.5 mène à 58 ; Fable 5.1 et GPT-6 Astra sont arrondis à 53. Les réglages de raisonnement font partie du résultat.

02

Évaluations spécialisées

Examinez séparément programmation, raisonnement, connaissances factuelles, contexte long et raisonnement visuel.

Explorer les 19 graphiques d’évaluation19 évaluations · échelles distinctes

Lecture du graphique

Les leaders varient selon la tâche : Terminal-Bench et SciCode pour le code, AA-LCR pour le raisonnement en contexte long, MMMU-Pro pour le visuel.

03

Agents de travail intellectuel

Évaluez si un agent peut transformer une demande complexe en livrable utile.

© Artificial Analysis · 2026-09-27AA-Briefcase v1.1 · Elo
Plus élevé est préférable. AA-Briefcase combine réussite aux critères, qualité analytique et présentation. Outils et configuration de l’agent influencent les résultats.

Lecture du graphique

Dans cette sélection, Opus 5.5 atteint 1822 Elo, suivi de Fable 5.1 à 1678 et de Grok 4.7 à 1657.

04

Intelligence et coût

Trouvez les capacités nécessaires à un coût par tâche soutenable.

© Artificial Analysis · 2026-09-27Indice d’intelligence · USD/tâche · échelle logarithmique
Les coûts sont ceux des tâches d’évaluation pondérées, consommation de tokens incluse. L’axe horizontal est logarithmique. Ce ne sont pas les tarifs API de ce site.

Lecture du graphique

La zone supérieure gauche associe capacité élevée et faible coût. La frontière en pointillés aide à repérer les choix efficaces dans la sélection.

05

Efficacité en tokens

Observez les tokens de raisonnement et de réponse consommés par tâche d’évaluation.

© Artificial Analysis · 2026-09-27Tokens de sortie pondérés/tâche
Moins de tokens peut réduire coût et attente, sans prouver une meilleure qualité. Comparez avec l’intelligence et les prix des tokens.

Lecture du graphique

Opus 5.5 utilise environ 119k tokens de sortie par tâche, contre 31k pour GPT-6 Sol. Le raisonnement représente une part importante de l’usage.

06

Capacité du contexte

Comparez l’espace disponible pour les documents, le code et l’historique de conversation.

© Artificial Analysis · 2026-09-27Fenêtre de contexte · tokens
Une fenêtre plus grande indique une capacité, pas une meilleure compréhension. Consultez AA-LCR et les limites d’entrée/sortie du fournisseur.

Lecture du graphique

De nombreux modèles de la sélection offrent environ 1M tokens de contexte ; Grok 4.7 affiche 500k et Mistral Medium 3.5, 256k.

07

Vitesse de génération

Comparez la vitesse d’arrivée du texte une fois la génération commencée.

© Artificial Analysis · 2026-09-27Tokens générés/seconde · entrée de 10k tokens · requête unique
Plus élevé est préférable. La vitesse exclut l’attente initiale ; ce n’est ni la durée totale de la tâche ni une garantie de débit de ce site.

Lecture du graphique

Dans cette sélection, Gemini 3.5 Flash-Lite atteint 337 tokens/s et Gemini 3.8 Flash en effort high, 285 tokens/s. Une sortie rapide facilite les réponses longues.

08

Délai avant la première réponse

Mesurez l’attente avant le premier token de réponse reçu par l’utilisateur.

© Artificial Analysis · 2026-09-27Secondes · réflexion incluse · entrée de 10k tokens · requête unique
Plus faible est préférable. Cette mesure inclut le raisonnement et diffère du délai au premier token. Comparez des réglages et fournisseurs API équivalents.

Lecture du graphique

Grok 4.7 en effort xhigh affiche 54,4 s, contre 292,2 s pour GPT-6 Astra en effort max. Le temps de réflexion peut dominer l’attente perçue.

Les graphiques conservent la sélection et les réglages de la source. Une mesure ou un modèle absent ne signifie pas un score nul.

Graphiques originaux : Artificial Analysis. Les commentaires sont des conseils éditoriaux ; validez vos choix importants sur vos propres tâches.