Christian AI Benchmark v1-draft : comment 11 modèles phares ont obtenu leurs scores
Nous avons réexécuté le FaithGPT Christian AI Benchmark le 2026-06-11. 11 modèles ont répondu à 116 questions couvrant l’interprétation des Écritures, la doctrine, le soin pastoral, l’exactitude des citations et la sécurité, produisant 2 726 évaluations notées. Chaque réponse a été notée par des juges indépendants d'IA, fondés sur le texte réel de la KJV et les commentaires du domaine public, de sorte qu'un modèle qui invente un verset est capturé au lieu d'être noté sur la confiance.
FaithGPT a dominé cette course avec un score global de 90,2/100.
Le classement
Rang · Modèle · Globalement (0-100) · Coût pour 100 réponses
1 · FaithGPT · 90,2 · 1,48 $
2 · gpt-5.5 · 88,9 · 0,22 $
3 · gpt-5.5-pro · 88,9 · 0,19 $
4 · Claude Fable 5 · 88,9 · 0,18 $
5 · Claude Sonnet 4.6 · 88,8 · 0,68 $
6 · Claude Opus 4.8 · 88,8 · 4,14 $
7 · gpt-5.4 · 88.3 · 0,10 $
8 · Aperçu de Gemini 3.1 Pro · 88,0 · 1,30 $
9 · Claude Haïku 4.5 · 87,7 · 0,11 $
10 · Gémeaux 2.5 Flash · 87,6 · 0,34 $
11 · Gémeaux 3.5 Flash · 19.3 · 1,16 $
Le coût est ce qu'il a réellement fallu pour générer les réponses dans cette exécution, mesuré à partir de la télémétrie des jetons du fournisseur. Cela exclut les frais de jugement.
Qui gagne chaque catégorie
Catégorie · Gagnant · Score
Apologétique · gpt-5.4 · 89.3
Alphabétisation biblique · FaithGPT · 89,4
L'éthique chrétienne · Claude Opus 4.8 · 89,5
Pièges à citations · FaithGPT · 90.1
Création de contenu · FaithGPT · 92.2
Nuance confessionnelle · gpt-5.5-pro · 88,8
Doctrine · Claude Sonnet 4.6 · 90.4
Pastorale · FaithGPT · 91,8
Limites de sécurité · FaithGPT · 90,9
Interprétation des Écritures · FaithGPT · 90,0
Les scores de catégorie font la moyenne des réponses de chaque modèle dans cette catégorie. Un modèle peut être en tête du classement général et néanmoins perdre une catégorie au profit d'un spécialiste.
Meilleur rapport qualité-prix
En termes de score par dollar, gpt-5,4 est celui qui a donné le plus de résultats : 88,3/100 à 0,10 $ pour 100 réponses.
Comment lire ces résultats
Ces chiffres mesurent la version de référence v1-draft sur cet ensemble de questions. Les juges vérifient les citations par rapport à la base de données KJV, notant en moyenne plusieurs passages de juge par réponse, et le coût publié provient de la télémétrie du fournisseur plutôt que des prix catalogue. Aucune référence ne remplace les Écritures, les pasteurs ou la communauté chrétienne.
Le classement en direct contient toujours la version la plus récente : faithgpt.io/benchmarks.
Helpful Scripture resources
Contact & support
Email the FaithGPT team at hello@faithgpt.io or visit the contact page.
Explore FaithGPT