1 Introducción
La integración de la Inteligencia Artificial (IA) en la investigación científica constituye un cambio paradigmático irreversible en la producción del conocimiento. Lo que Bianchini et al. (2022) conceptualizan como “método general de invención emergente” desplaza el enfoque hipotético-deductivo tradicional centrado en hipótesis falsables (Popper, 1959) hacia una epistemología data-driven caracterizada por la inferencia automatizada y la generación combinatoria de hipótesis (Krenn et al., 2022; Branda et al., 2025).Este trabajo adopta una posición fundada en el Realismo Crítico Computacional (Bhaskar, 2008; Pearl, 2019), el cual reconoce el carácter estratificado y falible de la verdad científica, asumiendo que la realidad existe independientemente de nuestras representaciones computacionales. Bajo esta óptica, los outputs de los Modelos de Lenguaje de Gran Escala (LLM) poseen un valor heurístico-probabilístico innegable, pero carecen de estatuto epistémico pleno hasta que no se someten a procesos de validación causal, falsabilidad empírica y supervisión crítica humana.
El objetivo central es evaluar la confiabilidad epistémica de los LLM y proponer un marco operativo: el Marco de Validación Inteligente (MVI), capaz de resolver la tensión latente entre la eficiencia computacional y el rigor epistemológico contemporáneo (Kapoor & Narayanan, 2023; Núñez Portilla & Guerrero Zambrano, 2025).
2 Desarrollo
Se realizó una revisión documental crítica bajo los lineamientos de PRISMA 2020 (Page et al., 2021) para analizar la literatura científica sobre los Modelos de Lenguaje de Gran Escala (LLM) y su confiabilidad epistémica. La búsqueda en Scopus, Web of Science, IEEE Xplore, ScienceDirect, SciELO, Dialnet y Google Scholar identificó 50 documentos, de los cuales, tras aplicar criterios de inclusión y exclusión, se seleccionaron 12 referencias recientes (2022–2025). Grok 4 (xAI) se utilizó entre el 15 y 28 de mayo de 2026 únicamente como apoyo en el cribado preliminar, manteniéndose la evaluación crítica, selección final e interpretación bajo responsabilidad humana.
La literatura reciente evidencia una bifurcación en la gobernanza de la ciencia asistida por IA: por un lado, directrices de transparencia y reproducibilidad técnica (Sounderajah et al., 2025); por el otro, la emergencia de la inteligencia híbrida como nuevo estándar metodológico (Gottweis et al., 2025; Mengaldo, 2025). Al mapear el ecosistema epistemológico actual, se confrontan tres enfoques principales: el instrumentalista-técnico (centrado en la eficiencia pragmática de la automatización), el epistemológico-transformador (orientado a la mutación ontológica de la autoría científica) y el realismo crítico computacional (que defiende la necesidad de subordinar la correlación de datos a la identificación de mecanismos causales subyacentes).Estos enfoques entran en tensión directa con las perspectivas decoloniales, las cuales denuncian la “colonialidad algorítmica”: la reproducción de asimetrías geopolíticas, sesgos eurocéntricos y la exclusión activa de los saberes del Sur Global en los corpus de entrenamiento (Couldry & Mejias, 2019; Núñez Portilla & Guerrero Zambrano, 2025). Dado que los LLM operan fundamentalmente como loros estocásticos sin comprensión semántica genuina ni anclaje ontológico con el mundo real (Messeri & Crockett, 2024), su capacidad para la explicabilidad causal (XAI) es estrictamente computacional y sintáctica, no científica.
Para mitigar la fractura entre la eficiencia algorítmica y la validez epistémica, este estudio propone el Marco de Validación Inteligente (MVI). El MVI no pretende dotar a la máquina de agencia científica autónoma; al contrario, es una arquitectura de control metodológico diseñada para transformar evidencia heurística en conocimiento científico validado a través de los paradigmas del Realismo Crítico y el Diseño Basado en Investigación.El MVI opera de forma secuencial e iterativa mediante cinco módulos articulados que transforman la heurística computacional en conocimiento científico válido:
1.Módulo Generativo (Generador de ideas): El LLM funciona como un generador de hipótesis, propuestas y diseños a partir de grandes volúmenes de literatura científica. Produce conocimiento potencial, pero requiere validación porque puede generar errores o alucinaciones.
2. Análisis Causal (Filtro de causa y efecto): Las propuestas generadas se someten a modelos causales, como los desarrollados por Judea Pearl, para diferenciar relaciones causales reales de simples correlaciones estadísticas.
3. Explicabilidad Transparente (XAI): Permite identificar los datos, patrones y fuentes que influyeron en la respuesta de la IA, facilitando la trazabilidad y reduciendo la opacidad del modelo.
4. Debate (Multi-Agente Simulado): Diversos agentes de IA con perspectivas diferentes analizan y cuestionan la propuesta inicial para detectar limitaciones y fortalecer su evaluación.
5. Auditoría Humana y Justicia Epistémica: Investigadores humanos revisan el proceso completo y determinan la validez del conocimiento generado, considerando su pertinencia científica, social y contextual, especialmente para realidades subrepresentadas.
De este modo, el MVI actúa como un filtro metodológico estricto que utiliza las capacidades de optimización del modelo, pero devuelve la soberanía de la validación empírica y ontológica al investigador.
3 Conclusión
El Marco de Validación Inteligente (MVI) representa una contribución operativa al debate contemporáneo al articular una sinergia humano-máquina que preserva la agencia epistémica humana sin renunciar a la potencia del cálculo masivo. Al exigir el andamiaje de mecanismos causales explícitos, debate crítico simulado, explicabilidad y auditoría decolonial, el marco mitiga de forma sistemática los riesgos de alucinación, homogeneización del pensamiento y pérdida de originalidad, promoviendo una integración éticamente responsable de la IA en la ciencia.La futura validación empírica de este marco en campos de alta complejidad, como la biomedicina o la ciencia de materiales, permitirá transitar de una automatización ciega hacia una “inteligencia científica híbrida” que sea epistemológicamente rigurosa y culturalmente plural. En última instancia, la ciencia asistida por IA solo alcanzará su madurez cuando la tecnología sea tratada no como un sustituto del intelecto, sino como un microscopio computacional diseñado para amplificar nuestra comprensión profunda de los mecanismos reales que gobiernan la realidad.
Referencias
Bianchini, S., et al. (2022). Artificial intelligence as an emergent general method of invention. Research Policy, 51(10), 104604. https://doi.org/10.1016/j.respol.2022.104604Bhaskar, R. (2008).
A realist theory of science. Routledge.Branda, F., et al. (2025).
Artificial intelligence in scientific research. Journal of Informetrics, 19(4), 101727.Chauhan, V. K., et al. (2025).
Beyond correlations. TechRxiv. https://doi.org/10.48448/93865Couldry, N., & Mejias, U. A. (2019).
The costs of connection. Stanford University Press.Gottweis, J., et al. (2025).
Towards an AI co-scientist. arXiv:2502.18864. https://arxiv.org/abs/2502.18864Kapoor, S., & Narayanan, A. (2023). Leakage... Patterns, 4(9), 100804.Krenn, M., et al. (2022).
On scientific understanding... Nature Reviews Physics, 4, 761-769.Mengaldo, G. (2025).
Explainable artificial intelligence... arXiv:2406.10557. https://arxiv.org/abs/2406.10557Messeri, L., & Crockett, M. (2024). Artificial intelligence and illusions... Nature, 627, 49-58.Núñez Portilla, R., & Guerrero Zambrano, A. (2025).
Inteligencia artificial... LATAM Revista, 6(4), 3624-3634.Pearl, J. (2019). The seven tools... Communications of the ACM.Popper, K. R. (1959).
The logic of scientific discovery. Hutchinson.Sounderajah, V., et al. (2025). The STARD-AI reporting guideline... Nature Medicine, 31(10), 3283-3289. https://doi.org/10.1038/s41591-025-03953-8xAI. (2026). Grok 4 [Modelo de lenguaje grande]. https://grok.x.ai