Christian AI Benchmark v1-draft: cómo calificaron 11 modelos líderes
Volvimos a ejecutar el FaithGPT Christian AI Benchmark el 11 de junio de 2026. 11 modelos respondieron 116 preguntas sobre interpretación de las Escrituras, doctrina, cuidado pastoral, precisión de las citas y seguridad, lo que produjo 2726 evaluaciones calificadas. Cada respuesta fue calificada por jueces independientes de IA basándose en el texto real de la KJV y comentarios de dominio público, por lo que un modelo que inventa un verso queda atrapado en lugar de calificarse según la confianza.
FaithGPT encabezó esta carrera con una puntuación general de 90,2/100.
La tabla de clasificación
Clasificación · Modelo · General (0-100) · Costo por 100 respuestas
1 · FeGPT · 90,2 · ,48
2 · gpt-5.5 · 88,9 · $0,22
3 · gpt-5.5-pro · 88,9 · $0,19
4 · Claude Fábula 5 · 88,9 · $0,18
5 · Claude Soneto 4.6 · 88,8 · $0,68
6 · Claude Opus 4.8 · 88,8 · $4.14
7 · gpt-5.4 · 88,3 · $0,10
8 · Vista previa de Géminis 3.1 Pro · 88,0 · ,30
9 · Claude Haiku 4.5 · 87,7 · $0,11
10 · Géminis 2.5 Flash · 87,6 · $0,34
11 · Géminis 3.5 Flash · 19.3 · ,16
El costo es lo que realmente se necesitó para generar las respuestas en esta ejecución, medido a partir de la telemetría del token del proveedor. Excluye el costo de juzgar.
Quién gana cada categoría
Categoría · Ganador · Puntuación
Apologética · gpt-5.4 · 89,3
Alfabetización bíblica · FeGPT · 89,4
Ética cristiana · Claude Opus 4.8 · 89,5
Trampas de citas · FeGPT · 90.1
Creación de contenidos · FeGPT · 92,2
Matiz denominacional · gpt-5.5-pro · 88,8
Doctrina · Claude Soneto 4.6 · 90,4
Atención pastoral · FeGPT · 91,8
Límites de seguridad · FeGPT · 90,9
Interpretación de las Escrituras · FeGPT · 90,0
Las puntuaciones de las categorías promedian las respuestas de cada modelo dentro de esa categoría. Un modelo puede liderar la general y aun así perder una categoría frente a un especialista.
Mejor valor
En puntuación por dólar, gpt-5,4 obtuvo la mayor puntuación: 88,3/100 a 0,10 dólares por cada 100 respuestas.
Cómo leer estos resultados
Estos números miden el borrador de la versión v1 de referencia en este conjunto de preguntas. Los jueces verifican las citas con la base de datos de la KJV, puntuando los promedios de múltiples pases de juez por respuesta, y el costo publicado proviene de la telemetría del proveedor en lugar de los precios de lista. Ningún punto de referencia reemplaza las Escrituras, los pastores o la comunidad cristiana.
La tabla de clasificación en vivo siempre incluye la versión más reciente: faithgpt.io/benchmarks.
Helpful Scripture resources
Contact & support
Email the FaithGPT team at hello@faithgpt.io or visit the contact page.
Explore FaithGPT