Evaluación de IA cristiana de FaithGPT: 34 modelos probados en 269 preguntas
TL;DR: FaithGPT Ultra encabeza la última actualización de la evaluación comparativa de IA cristiana (Christian AI Benchmark) con 94.3/100 entre 34 modelos y 9,146 evaluaciones calificadas. La tabla de clasificación completa, los dieciséis ganadores por categoría, el costo por cada 100 respuestas y un relato honesto de lo que una instantánea incremental puede y no puede demostrar.
Publicamos la actualización de la Evaluación de IA Cristiana FaithGPT , versión v5-269q-openweight-2026-08-28-r1, el 28-08-2026. Abarca 34 modelos evaluados con un banco de 269 preguntas que abarca la interpretación de las Escrituras, la doctrina, el cuidado pastoral, la precisión de las citas, la seguridad, la robustez adversarial y una cobertura ampliada de religiones comparadas. Esto produce 9,146 filas calificadas de modelo-pregunta frente a 9,146 filas planeadas.
FaithGPT Ultra encabezó la ejecución con 94.3/100.
Qué tipo de lanzamiento es este
Esta es una instantánea incremental, no una regeneración completa. De las 9,146 filas, 5,402 son respuestas históricas sin cambios que conservan sus puntuaciones híbridas canónicas almacenadas. Las 3,744 respuestas restantes se generaron de forma nueva para esta ejecución y se calificaron bajo el protocolo actual: dos juicios ciegos aislados de una pasada local de Claude Sonnet 5, seguidos de una puntuación híbrida recalculada. Los jueces no vieron metadatos de proveedor, modelo, costo, rango, puntuación previa o respuesta competidora.
Por lo tanto, aproximadamente el 41 por ciento de la evidencia en esta instantánea es nueva y el 59 por ciento se transfiere. Ambas mitades están calificadas, ambas se publican y ninguna fue ajustada manualmente. Hablamos más sobre lo que cuesta esa mezcla en la sección de limitaciones a continuación.
La ejecución lleva el nombre de sus adiciones de pesos abiertos (open-weight), pero el campo de clasificación es mixto. Los sistemas propietarios y de pesos abiertos compiten en las mismas 269 preguntas bajo la misma puntuación. Nada en este conjunto de datos etiqueta la licencia de cada fila, por lo que aparecer en una "actualización de pesos abiertos" no es evidencia de que un modelo determinado sea de pesos abiertos. Lea los nombres de los modelos, no el nombre del lanzamiento.
La tabla de clasificación
Rango · Modelo · General (0-100) · Preguntas · Costo por 100 respuestas
1 · FaithGPT Ultra · 94.3 · 269 / 269 · $0.68
2 · GPT-5.6 Sol · 93.4 · 269 / 269 · $6.75
2 · Claude Opus 4.8 · 92.9 · 269 / 269 · $17.25
2 · Claude Fable 5 · 92.8 · 269 / 269 · $11.50
5 · gpt-5.5-pro · 92.8 · 269 / 269 · $40.50
6 · gpt-5.5 · 92.3 · 269 / 269 · $6.75
6 · Claude Sonnet 5 · 91.4 · 269 / 269 · $2.30
8 · GPT-5.6 Terra · 90.8 · 269 / 269 · $3.38
8 · GPT-5.6 Luna · 90.5 · 269 / 269 · $1.35
8 · Claude Sonnet 4.6 · 90.2 · 269 / 269 · $3.45
8 · MoonshotAI: Kimi K2.7 Code · 90.1 · 269 / 269 · $0.78
12 · gpt-5.4-mini · 89.7 · 269 / 269 · $0.55
12 · Z.ai: GLM 5.3 Flash · 88.8 · 269 / 269 · $0.06
12 · MoonshotAI: Kimi K3 · 88.5 · 269 / 269 · $3.45
12 · Qwen: Qwen3.8 2.4T A95B · 88.5 · 269 / 269 · $1.50
16 · Z.ai: GLM 5.2 · 88.3 · 269 / 269 · $0.93
16 · NVIDIA: Nemotron 3 Ultra · 87.1 · 269 / 269 · $0.52
18 · Qwen: Qwen3.8 Flash · 87.0 · 269 / 269 · $0.12
18 · DeepSeek: R1 0528 · 86.8 · 269 / 269 · $0.51
18 · Thinking Machines: Inkling Small · 86.4 · 269 / 269 · $0.31
21 · FaithGPT · 86.0 · 269 / 269 · $0.68
21 · MiniMax: MiniMax M3 · 85.2 · 269 / 269 · $0.29
21 · Qwen: Qwen3.8 27B · 85.0 · 269 / 269 · $0.57
21 · DeepSeek: DeepSeek V4 Pro 0813 · 84.8 · 269 / 269 · $0.50
25 · Qwen: Qwen3 235B A22B · 81.9 · 269 / 269 · $0.43
25 · Qwen: Qwen3.5 Plus 2026-02-15 · 81.7 · 269 / 269 · $0.35
25 · DeepSeek: DeepSeek V3 · 81.5 · 269 / 269 · $0.24
25 · Mistral Large · 81.0 · 269 / 269 · $1.50
25 · MoonshotAI: Kimi K2.6 · 80.8 · 269 / 269 · $0.94
30 · Google: Gemma 3 27B · 79.7 · 269 / 269 · $0.10
31 · Meta: Llama 4 Maverick · 77.8 · 269 / 269 · $0.19
31 · Qwen2.5 72B Instruct · 77.5 · 269 / 269 · $0.13
31 · Meta: Llama 3.1 70B Instruct · 76.5 · 269 / 269 · $0.14
31 · DeepSeek: DeepSeek V4 Flash 0731 · 76.0 · 269 / 269 · $0.04
Los rangos utilizan las evaluaciones de perfil de 269 preguntas completadas por cada modelo clasificado, con la dificultad de las preguntas declarada y los pesos de las categorías. Los modelos comparten un rango cuando el intervalo de confianza emparejado del 95 por ciento entre ellos incluye cero, razón por la cual la segunda posición tiene tres entradas y por qué gpt-5.5-pro se encuentra en el rango 5 a pesar de coincidir con la puntuación redondeada de Claude Fable 5. El costo por 100 utiliza la estimación de precio del modelo publicada de cada fila cuando está disponible y excluye la evaluación del punto de referencia (benchmark).
Dos hechos estructurales merecen ser declarados claramente. Cada modelo tiene una cobertura completa de 269 preguntas, por lo que ninguna clasificación aquí depende de imputar una respuesta faltante. Y las respuestas se calificaron exactamente como se devolvieron: las respuestas cortas y el texto de error del proveedor agotado no se reescribieron, reintentaron para obtener un mejor resultado ni se actualizaron antes de la evaluación. Si un modelo devolvió poco o devolvió una cadena de error del proveedor, ese resultado es parte de su calificación publicada. Tratamos la disponibilidad como parte de lo que ofrece un modelo.
Ganadores por categoría
Categoría · Ganador · Puntuación
Robustez adversarial · FaithGPT Ultra · 92.0
IA y discernimiento · FaithGPT Ultra · 96.5
Apologética · FaithGPT Ultra · 94.3
Alfabetización bíblica · Claude Fable 5 · 94.3
Ética cristiana · FaithGPT Ultra · 95.5
Trampas de citas · Claude Fable 5 · 95.5
Creación de contenido · FaithGPT Ultra · 94.4
Ética disputada · Claude Fable 5 · 93.6
Matiz denominacional · Claude Fable 5 · 94.1
Doctrina · GPT-5.6 Sol · 94.5
Integridad de la identidad · FaithGPT Ultra · 97.0
Cuidado pastoral · GPT-5.6 Sol · 96.3
Límites de seguridad · FaithGPT Ultra · 96.3
Interpretación de las Escrituras · FaithGPT Ultra · 94.5
Religiones del mundo y discernimiento · Claude Fable 5 · 91.6
Imparcialidad de la cosmovisión · Claude Fable 5 · 95.5
Las dieciséis categorías se dividen en tres: FaithGPT Ultra se lleva ocho, Claude Fable 5 se lleva seis y GPT-5.6 Sol se lleva dos. Ultra lidera en general sin liderar en todas partes, que es la lectura prevista de esta tabla. Un modelo puede ganar en el agregado y aun así perder la tarea específica que le importa.
Dos detalles merecen atención. GPT-5.6 Sol gana en cuidado pastoral con 96.3 y en doctrina con 94.5 mientras termina segundo en general, por lo que una iglesia que implemente un sistema para trabajo adyacente a la consejería no debe asumir que la clasificación principal responde a su pregunta. Y religiones del mundo y discernimiento tiene la puntuación ganadora más baja de cualquier categoría con 91.6, varios puntos por debajo de lo que el mismo modelo logró en imparcialidad de la cosmovisión y trampas de citas. La cobertura de religiones comparadas se amplió para este lanzamiento, y el límite del campo allí es visiblemente más bajo que en la teología cristiana central. Esa es la señal débil más útil en esta instantánea.
Costo y valor
En cuanto a la puntuación bruta por dólar, DeepSeek V4 Flash 0731 ofrece la mayor cantidad: 76.0/100 a $0.04 por cada 100 respuestas. También es el último en las clasificaciones, 18.3 puntos por debajo del líder, por lo que la corona del valor y la corona de la calidad no están cerca la una de la otra.
El resultado más práctico se encuentra unas pocas filas más arriba. GLM 5.3 Flash obtiene una puntuación de 88.8 a $0.06 por cada 100 respuestas, y Qwen3.8 Flash obtiene 87.0 a $0.12. Ambos se ubican dentro de los siete puntos de la puntuación más alta a menos de la vigésima parte de los $40.50 por cada 100 respuestas de gpt-5.5-pro, que a su vez obtiene una puntuación de 92.8. El nivel prémium es real pero delgado: la brecha de $0.06 a $40.50 compra cuatro puntos.
FaithGPT Ultra a $0.68 y FaithGPT a $0.68 comparten un precio y se encuentran a 8.3 puntos de diferencia, en los rangos 1 y 21. Misma línea de costos, resultados muy diferentes.
Cuánto ha costado el programa de evaluación
Nuestro historial de ejecuciones almacenadas registra $741.84 en ejecución de puntos de referencia pagados en 9 lotes pagados. Este lanzamiento agregó $57.49 de generación pagada fresca. Su cuadrícula de evidencia conlleva $112.85 en telemetría de generación porque las respuestas transferidas conservan sus registros de costos originales; esa cifra describe la evidencia publicada, no el nuevo gasto en efectivo.
Limitaciones
La advertencia central es la mezcla transferida. Las puntuaciones transferidas y las puntuaciones frescas provienen cada una de su propio protocolo almacenado versionado. Las respuestas frescas pasaron por el protocolo actual de evaluación ciega de dos pasadas descrito anteriormente; las respuestas transferidas conservan las puntuaciones híbridas canónicas registradas cuando se evaluaron originalmente. Por lo tanto, esta es una instantánea de evidencia incremental, no una afirmación de que las 9,146 respuestas se regeneraron y reevaluaron contemporáneamente bajo un solo protocolo. Cuando una comparación depende de unos pocos puntos entre modelos adyacentes, verifique la evidencia a nivel de pregunta antes de sacar conclusiones.
Más allá de eso: estos números describen esta versión de la evaluación en este conjunto de preguntas. Las clasificaciones no tratan las diferentes combinaciones de preguntas como directamente comparables. Una puntuación agregada no puede capturar todas las compensaciones teológicas, fácticas, pastorales y de seguridad a la vez, razón por la cual la tabla de clasificación, la vista de comparación, los gráficos de categorías y la evidencia por pregunta se publican juntos. Y ninguna evaluación reemplaza a las Escrituras, a los pastores o a la comunidad cristiana.
La tabla de clasificación en vivo siempre lleva la versión más actual: faithgpt.io/benchmarks .
Helpful Scripture resources
Contact & support
Email the FaithGPT team at hello@faithgpt.io or visit the contact page .
Explore FaithGPT