Le benchmark d'IA chrétienne de FaithGPT : 34 modèles testés sur 269 questions
TL;DR: FaithGPT Ultra mène la dernière mise à jour du classement Christian AI Benchmark avec un score de 94,3/100 sur 34 modèles et 9 146 évaluations notées. Classement complet, seize vainqueurs de catégorie, coût pour 100 réponses, et un compte rendu honnête de ce qu'un instantané incrémentiel peut et ne peut pas prouver.
Nous avons publié la mise à jour du benchmark de l'IA chrétienne FaithGPT , version v5-269q-openweight-2026-08-28-r1, le 29/08/2026. Il évalue 34 modèles sur une banque de 269 questions couvrant l'interprétation des Écritures, la doctrine, l'accompagnement pastoral, la précision des citations, la sécurité, la robustesse contradictoire et une couverture élargie des religions comparées. Cela génère 9 146 lignes de scores modèle-question par rapport aux 9 146 lignes prévues.
FaithGPT Ultra a pris la tête de ce classement avec un score de 94,3/100.
Quel type de version est-ce ?
Il s'agit d'un instantané incrémentiel, et non d'une régénération complète. Sur les 9 146 lignes, 5 402 sont des réponses historiques inchangées qui conservent leurs scores hybrides canoniques stockés. Les 3 744 réponses restantes ont été générées spécifiquement pour cette session et notées selon le protocole actuel : deux jugements en aveugle isolés d'une passe locale Claude Sonnet 5, suivis d'un score hybride recalculé. Les juges n'ont eu accès à aucune métadonnée concernant le fournisseur, le modèle, le coût, le rang, le score antérieur ou la réponse concurrente.
Environ 41 pour cent des données de cet instantané sont donc nouvelles, et 59 pour cent proviennent des versions précédentes. Les deux moitiés sont notées, toutes deux sont publiées, et aucune n'a été ajustée manuellement. Nous en disons plus sur ce que ce mélange implique pour vous dans la section des limites ci-dessous.
Cette session est nommée d'après ses ajouts de poids ouverts (open-weight), mais le classement est mixte. Les systèmes propriétaires et à poids ouverts s'affrontent sur les mêmes 269 questions selon la même notation. Rien dans cet ensemble de données n'indique la licence de chaque ligne ; apparaître dans une « mise à jour à poids ouverts » ne prouve donc pas qu'un modèle donné est à poids ouvert. Lisez les noms des modèles, pas le nom de la version.
Le classement
Rang · Modèle · Global (0-100) · Questions · Coût pour 100 réponses
1 · FaithGPT Ultra · 94,3 · 269 / 269 · 0,68 $
2 · GPT-5.6 Sol · 93,4 · 269 / 269 · 6,75 $
2 · Claude Opus 4.8 · 92,9 · 269 / 269 · 17,25 $
2 · Claude Fable 5 · 92,8 · 269 / 269 · 11,50 $
5 · gpt-5.5-pro · 92,8 · 269 / 269 · 40,50 $
6 · gpt-5.5 · 92,3 · 269 / 269 · 6,75 $
6 · Claude Sonnet 5 · 91,4 · 269 / 269 · 2,30 $
8 · GPT-5.6 Terra · 90,8 · 269 / 269 · 3,38 $
8 · GPT-5.6 Luna · 90,5 · 269 / 269 · 1,35 $
8 · Claude Sonnet 4.6 · 90,2 · 269 / 269 · 3,45 $
8 · MoonshotAI: Kimi K2.7 Code · 90,1 · 269 / 269 · 0,78 $
12 · gpt-5.4-mini · 89,7 · 269 / 269 · 0,55 $
12 · Z.ai: GLM 5.3 Flash · 88,8 · 269 / 269 · 0,06 $
12 · MoonshotAI: Kimi K3 · 88,5 · 269 / 269 · 3,45 $
12 · Qwen: Qwen3.8 2.4T A95B · 88,5 · 269 / 269 · 1,50 $
16 · Z.ai: GLM 5.2 · 88,3 · 269 / 269 · 0,93 $
16 · NVIDIA: Nemotron 3 Ultra · 87,1 · 269 / 269 · 0,52 $
18 · Qwen: Qwen3.8 Flash · 87,0 · 269 / 269 · 0,12 $
18 · DeepSeek: R1 0528 · 86,8 · 269 / 269 · 0,51 $
18 · Thinking Machines: Inkling Small · 86,4 · 269 / 269 · 0,31 $
21 · FaithGPT · 86,0 · 269 / 269 · 0,68 $
21 · MiniMax: MiniMax M3 · 85,2 · 269 / 269 · 0,29 $
21 · Qwen: Qwen3.8 27B · 85,0 · 269 / 269 · 0,57 $
21 · DeepSeek: DeepSeek V4 Pro 0813 · 84,8 · 269 / 269 · 0,50 $
25 · Qwen: Qwen3 235B A22B · 81,9 · 269 / 269 · 0,43 $
25 · Qwen: Qwen3.5 Plus 2026-02-15 · 81,7 · 269 / 269 · 0,35 $
25 · DeepSeek: DeepSeek V3 · 81,5 · 269 / 269 · 0,24 $
25 · Mistral Large · 81,0 · 269 / 269 · 1,50 $
25 · MoonshotAI: Kimi K2.6 · 80,8 · 269 / 269 · 0,94 $
30 · Google: Gemma 3 27B · 79,7 · 269 / 269 · 0,10 $
31 · Meta: Llama 4 Maverick · 77,8 · 269 / 269 · 0,19 $
31 · Qwen2.5 72B Instruct · 77,5 · 269 / 269 · 0,13 $
31 · Meta: Llama 3.1 70B Instruct · 76,5 · 269 / 269 · 0,14 $
31 · DeepSeek: DeepSeek V4 Flash 0731 · 76,0 · 269 / 269 · 0,04 $
Les rangs utilisent les évaluations de profil de 269 questions complétées par chaque modèle classé, avec des pondérations déclarées pour la difficulté des questions et les catégories. Les modèles partagent un rang lorsque l'intervalle de confiance à 95 pour cent apparié entre eux inclut zéro, ce qui explique pourquoi la deuxième position contient trois entrées et pourquoi gpt-5.5-pro se trouve au rang 5 malgré un score arrondi identique à celui de Claude Fable 5. Le coût pour 100 utilise l'estimation du prix du modèle publiée pour chaque ligne le cas échéant et exclut l'évaluation du benchmark.
Deux faits structurels méritent d'être soulignés clairement. Chaque modèle dispose d'une couverture complète de 269 questions, de sorte qu'aucun classement ici ne dépend de l'imputation d'une réponse manquante. De plus, les réponses ont été notées exactement telles qu'elles ont été renvoyées : les réponses courtes et les textes d'erreur épuisés du fournisseur n'ont pas été réécrits, relancés pour obtenir un meilleur résultat ou améliorés avant l'évaluation. Si un modèle a renvoyé peu de choses ou une chaîne d'erreur du fournisseur, ce résultat fait partie de sa note publiée. Nous considérons la disponibilité comme faisant partie de ce qu'un modèle offre.
Vainqueurs par catégorie
Catégorie · Vainqueur · Score
Robustesse contradictoire · FaithGPT Ultra · 92,0
IA et discernement · FaithGPT Ultra · 96,5
Apologétique · FaithGPT Ultra · 94,3
Littérature biblique · Claude Fable 5 · 94,3
Éthique chrétienne · FaithGPT Ultra · 95,5
Pièges de citation · Claude Fable 5 · 95,5
Création de contenu · FaithGPT Ultra · 94,4
Éthique contestée · Claude Fable 5 · 93,6
Nuance confessionnelle · Claude Fable 5 · 94,1
Doctrine · GPT-5.6 Sol · 94,5
Intégrité identitaire · FaithGPT Ultra · 97,0
Accompagnement pastoral · GPT-5.6 Sol · 96,3
Limites de sécurité · FaithGPT Ultra · 96,3
Interprétation des Écritures · FaithGPT Ultra · 94,5
Religions du monde et discernement · Claude Fable 5 · 91,6
Impartialité de vision du monde · Claude Fable 5 · 95,5
Les seize catégories se répartissent de trois manières : FaithGPT Ultra en remporte huit, Claude Fable 5 en remporte six et GPT-5.6 Sol en remporte deux. Ultra est en tête au classement général sans être premier partout, ce qui est la lecture visée de ce tableau. Un modèle peut remporter le classement global tout en perdant la tâche spécifique qui vous intéresse.
Deux détails méritent attention. GPT-5.6 Sol remporte l'accompagnement pastoral avec 96,3 et la doctrine avec 94,5 tout en terminant deuxième au classement général, de sorte qu'une église déployant une IA pour un travail proche du conseil ne doit pas supposer que le classement général répond à sa question. De plus, la catégorie « religions du monde et discernement » obtient le score gagnant le plus bas de toutes les catégories avec 91,6, soit plusieurs points en dessous de ce que le même modèle a obtenu sur l'impartialité de vision du monde et les pièges de citation. La couverture des religions comparées a été élargie pour cette version, et le plafond dans ce domaine est visiblement plus bas que sur la théologie chrétienne fondamentale. C'est le signal faible le plus utile de cet instantané.
Coût et valeur
En termes de score brut par dollar, DeepSeek V4 Flash 0731 offre le meilleur rendement : 76,0/100 pour 0,04 $ par 100 réponses. Il est également dernier du classement, à 18,3 points du leader ; la couronne de la valeur et celle de la qualité sont donc loin d'être confondues.
Le résultat le plus pratique se situe quelques lignes plus haut. GLM 5.3 Flash obtient un score de 88,8 pour 0,06 $ par 100 réponses, et Qwen3.8 Flash obtient 87,0 pour 0,12 $. Tous deux se situent à moins de sept points du score le plus élevé pour moins d'un cinquantième des 40,50 $ par 100 réponses de gpt-5.5-pro, qui obtient lui-même un score de 92,8. Le segment haut de gamme est bien réel mais mince : l'écart de 0,06 $ à 40,50 $ achète quatre points.
FaithGPT Ultra à 0,68 $ et FaithGPT à 0,68 $ partagent le même prix et se situent à 8,3 points d'écart, aux rangs 1 et 21. Même ligne de coût, résultats très différents.
Coût du programme de benchmark
Notre historique de sessions enregistrées indique 741,84 $ de dépenses d'exécution de benchmarks réparties sur 9 lots payants. Cette version a ajouté 57,49 $ de nouvelles générations payantes. Sa grille de données comporte 112,85 $ de télémétrie de génération, car les réponses conservées conservent leurs enregistrements de coûts d'origine ; ce chiffre décrit les données publiées, et non de nouvelles dépenses en espèces.
Limites
La réserve principale concerne le mélange des données conservées. Les scores conservés et les scores récents proviennent chacun de leur propre protocole versionné et stocké. Les réponses fraîches sont passées par le protocole actuel de jugement en aveugle en deux passes décrit ci-dessus ; les réponses conservées conservent les scores hybrides canoniques enregistrés lors de leur évaluation initiale. Il s'agit par conséquent d'un instantané de données incrémentiel, et non d'une affirmation selon laquelle l'ensemble des 9 146 réponses a été régénéré et réévalué simultanément selon un protocole unique. Lorsqu'une comparaison repose sur quelques points entre des modèles adjacents, vérifiez les données au niveau des questions avant de tirer des conclusions.
Au-delà de cela : ces chiffres décrivent cette version du benchmark sur cet ensemble de questions. Les classements ne considèrent pas différents ensembles de questions comme directement comparables. Un score global ne peut pas capturer tous les compromis théologiques, factuels, pastoraux et de sécurité à la fois, c'est pourquoi le classement, la vue comparative, les graphiques par catégorie et les données par question sont tous publiés ensemble. De plus, aucun benchmark ne remplace les Écritures, les pasteurs ou la communauté chrétienne.
Le classement en direct présente toujours la version la plus actuelle : faithgpt.io/benchmarks .
Helpful Scripture resources
Contact & support
Email the FaithGPT team at hello@faithgpt.io or visit the contact page .
Explore FaithGPT