El problema del corpus científico y el entrenamiento de la IA

Esa “papelera de reciclaje” no es automáticamente la zona donde está el descubrimiento; es una de las zonas donde aumenta la probabilidad de encontrar señales que el proceso científico convencional ha infraexplorado.

La intuición que planteas tiene bastante fuerza desde el punto de vista de IA.

El problema del corpus científico

Un modelo entrenado predominantemente sobre literatura publicada recibe un sesgo estructural:

lo publicado → lo considerado relevante → lo que recibe citas → lo que vuelve a aparecer en el entrenamiento.

Mientras que:

lo rechazado → lo ridiculizado → lo abandonado → lo difícil de publicar → desaparece progresivamente del corpus.

Esto genera un fenómeno interesante: el modelo aprende muy bien el espacio de soluciones que la comunidad ha considerado legítimas, pero puede aprender peor el espacio de hipótesis que fueron descartadas prematuramente.

Y ahí aparece una posibilidad mucho más interesante que simplemente pedirle a una IA que "invente teorías".

La verdadera operación sería otra

No:

«IA, descubre una teoría nueva».

Sino:

«IA, reconstruye el espacio de hipótesis que la ciencia exploró, incluyendo sus ramas muertas, y determina cuáles fueron descartadas por evidencia, cuáles por problemas matemáticos, cuáles por problemas experimentales y cuáles simplemente por dinámica sociológica del campo».

Eso cambia radicalmente el problema.

Porque una IA podría construir un grafo de genealogía de ideas:

                 PROBLEMA FÍSICO
                       │
          ┌────────────┴────────────┐
          │                         │
     paradigma A                paradigma B
          │                         │
     publicado                 rechazado
          │                         │
    refinamientos            variantes olvidadas
          │                         │
       consenso             anomalías / excepciones
          │                         │
          └────────────┬────────────┘
                       ↓
              RECONSTRUCCIÓN IA
                       ↓
              hipótesis híbridas
                       ↓
              predicciones nuevas

La cuestión verdaderamente revolucionaria sería que la IA pudiera recombinar ramas que históricamente nunca fueron recombinadas por investigadores humanos.

Y esto conecta directamente con tu CPEA/TAE: no sería simplemente aprendizaje por acumulación, sino aprendizaje por excepción.

¿Y el ejemplo de Weinstein?

Aquí conviene separar dos cosas.

La afirmación de que China podría entrenar privadamente un modelo que considere la teoría de cuerdas/M como una vía históricamente infructuosa es una hipótesis estratégica, no algo que podamos afirmar que esté ocurriendo.

Pero el experimento mental es excelente.

Imagina dos modelos:

Modelo A

Entrenamiento:

papers + citas + consenso + teorías dominantes.

Su prior implícito sería aproximadamente:

P(HD)P(DH)P(H)P(H|\mathcal D) \propto P(\mathcal D|H)P(H)

donde el prior P(H)P(H) está fuertemente condicionado por la distribución histórica de la literatura.

Modelo B

Entrenamiento:

papers + preprints + resultados negativos + artículos rechazados + controversias + líneas abandonadas + inconsistencias + datos anómalos.

Entonces el modelo B dispone de un espacio epistemológico mucho más grande.

No significa que el modelo B tenga razón.

Significa que puede buscar en lugares que el modelo A prácticamente ha aprendido a ignorar.

Y aquí aparece algo todavía más profundo

La pregunta que propones:

«¿Qué pretendía evitar que viéramos ese trabajo?»

es muy potente, pero una IA científica rigurosa debería reformularla.

No debería asumir que alguien estaba intentando ocultar algo.

Debería preguntar:

¿Qué hipótesis, observación o estructura matemática quedó excluida por el marco teórico dominante?

Eso elimina la narrativa conspirativa y conserva la potencia epistemológica.

Porque puede ocurrir algo mucho más interesante:

nadie estaba ocultando nada.

Simplemente, un paradigma puede tener mecanismos internos que hacen que determinadas preguntas sean:

  • poco financiables,
  • difíciles de publicar,
  • metodológicamente incómodas,
  • incompatibles con las herramientas disponibles,
  • consideradas "no interesantes",
  • o demasiado alejadas del lenguaje dominante.

La IA podría detectar precisamente esas zonas de baja densidad epistemológica.

Ahí sí veo una posibilidad enorme para la IA

La IA científica del futuro podría dejar de comportarse como:

bibliotecario → sintetizador → predictor

y convertirse progresivamente en:

cartógrafo del espacio epistemológico.

Podría calcular algo parecido a una topología de la investigación:

E={Hi,Di,Ri,Ai,Ci}\mathcal{E} = \{H_i, D_i, R_i, A_i, C_i\}

donde:

  • HiH_i = hipótesis,
  • DiD_i = datos disponibles,
  • RiR_i = resultados negativos,
  • AiA_i = anomalías,
  • CiC_i = conexiones entre campos.

Entonces buscaría regiones con una combinación particularmente interesante:

intereˊs(H)anomalıˊa×baja exploracioˊn×coherencia×testabilidad\text{interés}(H) \sim \text{anomalía} \times \text{baja exploración} \times \text{coherencia} \times \text{testabilidad}

Eso es mucho más interesante que buscar simplemente las hipótesis con mayor número de citas.

Y aquí enlaza directamente con TAE

Tu concepto de aprendizaje por excepción adquiere una interpretación particularmente fértil.

El sistema convencional aprende:

regularidadmodelo\text{regularidad} \rightarrow \text{modelo}

Una arquitectura TAE/CPEA podría invertir parcialmente el proceso:

regularidadexcepcioˊnerror predictivorevisioˊn del modelo\text{regularidad} \rightarrow \text{excepción} \rightarrow \text{error predictivo} \rightarrow \text{revisión del modelo}

Y añadir:

excepciones histoˊricasreconstruccioˊn de hipoˊtesis descartadasnuevas combinaciones\text{excepciones históricas} \rightarrow \text{reconstrucción de hipótesis descartadas} \rightarrow \text{nuevas combinaciones}

Esto tiene una consecuencia enorme.

El error deja de ser basura.

Se convierte en información sobre los límites del modelo.

¿Llegará la IA allí?

Mi respuesta es:

sí, probablemente, pero no simplemente aumentando el tamaño del modelo.

El salto importante será arquitectónico.

Una IA capaz de descubrimiento científico profundo necesitaría, aproximadamente:

1. Memoria histórica

No solamente el conocimiento vigente, sino también el conocimiento descartado.

2. Modelado de incertidumbre

Distinguir:

falsono demostradoincompatibleno explorado\text{falso} \neq \text{no demostrado} \neq \text{incompatible} \neq \text{no explorado}

3. Razonamiento contrafactual

«¿Qué habría ocurrido si esta hipótesis descartada se hubiese combinado con aquella tecnología desarrollada 30 años después?»

4. Detección de anomalías

Buscar aquello que no encaja con los modelos dominantes.

5. Generación de hipótesis

No solamente resumir literatura.

6. Simulación

Convertir hipótesis en consecuencias cuantitativas.

7. Experimentación

Diseñar experimentos que discriminen entre hipótesis.

Y finalmente:

IA cientıˊfica=conocimiento+excepciones+razonamiento+simulacioˊn+experimento\boxed{ \text{IA científica} = \text{conocimiento} + \text{excepciones} + \text{razonamiento} + \text{simulación} + \text{experimento} }

Ahí empieza algo cualitativamente diferente.

Y hay una última vuelta de tuerca

Quizá el mayor descubrimiento de la IA no sea encontrar la teoría correcta dentro de la papelera.

Puede ser descubrir que la propia división entre "teoría aceptada" y "teoría descartada" era una representación demasiado pobre del espacio de posibilidades.

Es decir:

descubrimientoencontrar una idea olvidada\boxed{ \text{descubrimiento} \neq \text{encontrar una idea olvidada} }

sino:

descubrimiento=encontrar relaciones que el espacio epistemoloˊgico humano no estaba representando\boxed{ \text{descubrimiento} = \text{encontrar relaciones que el espacio epistemológico humano no estaba representando} }

Y eso sí me parece una de las fronteras más interesantes de la IA científica.

En el contexto CPEA–TAE, yo lo formularía como una transición desde aprendizaje por regularidad hacia exploración activa del espacio de excepciones. La IA no sustituiría al científico: podría convertirse en un sistema que explora sistemáticamente las regiones que la cultura científica humana tiende a abandonar.

Y entonces la pregunta deja de ser «¿puede la IA descubrir?».

Pasa a ser:

¿podemos construir una IA que no herede nuestros puntos ciegos epistemológicos?

Ahí, efectivamente, puede estar una parte importante de la reinvención.

Comentarios

Entradas populares