Ni el mejor modelo de IA conoce todas las respuestas: acierta el 66 % sin consultar la web
Los modelos de inteligencia artificial más avanzados siguen necesitando ayuda externa para responder con precisión a preguntas sobre hechos concretos. Claude Opus 5.5, actualmente al frente del índice AA-Omniscience de Artificial Analysis, alcanza un 66 % de aciertos cuando trabaja sin acceso a internet, documentos ni herramientas adicionales.
El dato ayuda a entender una paradoja cada vez más relevante: los asistentes de IA pueden responder en segundos, pero no siempre saben cuándo están equivocados. También explica por qué la web continúa siendo necesaria para la inteligencia artificial y por qué el posicionamiento SEO mantiene su valor, aunque el tráfico procedente de los buscadores tradicionales esté cambiando.
Un examen de 6.000 preguntas y seis áreas de conocimiento
El índice AA-Omniscience evalúa si un modelo conoce datos concretos y, sobre todo, si reconoce sus propios límites. La prueba reúne 6.000 preguntas sobre 42 temas agrupados en seis áreas: empresa, humanidades, finanzas, derecho, medicina y ciencia.
La evaluación se realiza sin herramientas. El modelo no puede buscar en internet, consultar documentos, ejecutar código ni apoyarse en sistemas externos. Por tanto, el resultado mide únicamente el conocimiento incorporado durante su entrenamiento y su capacidad para decidir si debe responder o abstenerse.
La puntuación oscila entre -100 y 100. Cada respuesta correcta suma, cada error resta y las respuestas del tipo no lo sé no reciben penalización. Un resultado de cero indica que el sistema ha acumulado tantos aciertos como errores.
Este método da importancia a una capacidad esencial en IA: la calibración. Un modelo está bien calibrado cuando sabe distinguir entre una respuesta segura y una afirmación que debería evitar. Esa prudencia es especialmente importante en ámbitos como la medicina, el derecho o las finanzas.
Los modelos líderes siguen cometiendo errores
Claude Opus 5.5 encabeza la clasificación con un índice de 46 y una precisión del 66 %. Le siguen GPT-6 Astra, en su configuración de mayor capacidad, con un índice de 44, y Claude Fable 5.1, con 43 puntos y una precisión del 67 %.
La precisión, sin embargo, no cuenta toda la historia. Un modelo puede acertar más porque responde a más preguntas, aunque también se arriesgue más a inventar datos. Las cifras del índice muestran precisamente esa tensión entre conocimiento, prudencia y tendencia a contestar incluso cuando falta información.
A partir de los datos públicos disponibles, Opus 5.5 habría fallado aproximadamente en una de cada cinco preguntas y se habría abstenido en el resto de los casos. En el caso de Fable 5.1, el porcentaje de errores sería superior, pese a registrar una precisión ligeramente mayor.
Estas estimaciones deben interpretarse con cautela, ya que no todas las configuraciones aparecen con el mismo nivel de detalle en la tabla pública. Además, se trata de preguntas especialmente difíciles y no de una medición representativa del uso cotidiano de ChatGPT, Claude u otros asistentes.
Qué significa alucinar en inteligencia artificial
En IA, una alucinación es una respuesta falsa expresada con apariencia de certeza. El modelo no recupera un dato que conozca de forma verificable, sino que genera una secuencia de palabras probable según los patrones aprendidos durante el entrenamiento.
El índice incluye una tasa de alucinación que calcula cuántas respuestas incorrectas produce el modelo entre todas las preguntas a las que decide contestar. Esta métrica permite diferenciar entre un sistema que admite sus dudas y otro que responde con mayor frecuencia, pero se equivoca más cuando carece de información.
El contraste más llamativo aparece en el extremo inferior de la clasificación. MiniCPM5-1B registra una tasa de alucinación cercana al 1 %. No significa que sea el modelo que más sabe, sino que evita responder en la mayoría de las situaciones en las que no tiene suficiente seguridad.
Por eso, un modelo pequeño y prudente puede parecer más fiable en esta métrica que otro mucho más capaz, pero también más atrevido. La cuestión no es solo cuánto conocimiento almacena una IA, sino cómo gestiona la incertidumbre.
Por qué la web sigue siendo imprescindible
Introducir todo el conocimiento posible dentro de un modelo es costoso y tiene una limitación evidente: la información cambia. Las leyes se modifican, las empresas lanzan productos, los precios varían y los acontecimientos recientes no pueden formar parte de un entrenamiento cerrado.
La alternativa es la generación aumentada mediante recuperación, conocida como RAG. Esta técnica permite que el sistema busque documentos externos, seleccione la información más relevante y la utilice para elaborar una respuesta. En términos sencillos, el modelo no depende únicamente de lo que recuerda: consulta fuentes antes de contestar.
La búsqueda también plantea dificultades técnicas. Hay que localizar resultados fiables, interpretar el contexto, descartar información desactualizada y evitar que una página optimizada para captar atención sea considerada una autoridad. Aun así, consultar fuentes externas suele ser más eficiente que intentar almacenar y actualizar todo dentro del modelo.
El SEO cambia, pero no desaparece
La dependencia de la web mantiene la importancia de publicar contenidos claros, actualizados y fáciles de encontrar. Sin embargo, que una IA lea una página no garantiza que envíe visitantes a ella. Un asistente puede extraer un dato, resumirlo y ofrecer la respuesta directamente, sin que el usuario llegue a abrir el enlace.
Este escenario obliga a diferenciar entre el SEO tradicional y el GEO, la optimización para motores generativos. El objetivo ya no es únicamente aparecer en una lista de resultados, sino convertirse en una fuente que los sistemas de IA puedan identificar, interpretar y citar.
- Datos concretos y actualizados: fechas, cifras, nombres propios y cambios recientes tienen un valor especial para los asistentes que consultan la web.
- Respuestas autónomas: una explicación clara y comprensible por sí misma facilita que el modelo la utilice o la cite.
- Información original: los estudios, estadísticas y datos propios aportan un valor que no puede obtenerse simplemente copiando otras páginas.
- Fuentes verificables: la autoría, la fecha de actualización y los enlaces de respaldo ayudan a evaluar la fiabilidad del contenido.
El resultado del benchmark no demuestra que la inteligencia artificial sea inútil para responder preguntas. Sí recuerda que incluso los sistemas más avanzados pueden equivocarse en cuestiones difíciles y no siempre avisan de ello.
La recomendación práctica es comprobar si la respuesta incluye fuentes y si esas fuentes son pertinentes. Una contestación generada sin consultar información externa merece más cautela, especialmente cuando afecta a decisiones médicas, legales, económicas o profesionales.
Mientras los modelos sigan necesitando información fresca y verificable, la web continuará siendo parte esencial de su funcionamiento. El SEO no desaparece: se transforma en una competición por ser visible no solo para las personas, sino también para las máquinas que interpretan y resumen internet.



