La corteza IT y la IA
https://www.cell.com/current-biology/abstract/S0960-9822(26)01197-8
¿La corteza IT (temporal inferior) no solo codifica qué son los objetos, sino también dónde están?, ¿la IA actual reproduce este mecanismo de la misma manera, o no?.
Tradicionalmente se pensaba que la vía ventral (la qué) solo identificaba objetos y la dorsal (la de dónde) se encargaba del espacio. Sin embargo, investigaciones recientes muestran que la corteza IT también contiene información sobre la posición del objeto.
Esta codificación de posición en la IT es perceptualmente relevante, no un simple reflejo de la ubicación en la retina. Los autores usaron la ilusión del post-efecto de movimiento para disociar la posición percibida de la posición retiniana real. Descubrieron que, tras adaptarse a un movimiento, las respuestas neuronales en la IT de los macacos mostraban un sesgo direccional que coincidía con los informes perceptuales de humanos en la misma tarea. Es decir, la IT codifica la posición tal como la percibimos, no solo como llega a nuestros ojos.
El mismo estudio comparó el comportamiento de la corteza IT con el de redes neuronales artificiales (tanto feedforward como recurrentes y de video de última generación). Los resultados arrojaron que:
1- Las redes artificiales pueden decodificar la posición, pero solo de forma estática y retinotópica.
2- Ninguna de las redes probadas (AlexNet, VGG, ResNet, ViT, SlowFast) logró reproducir el sesgo perceptual inducido por la adaptación al movimiento que sí se observa en la IT y en humanos.
3- Los investigadores concluyen que las redes actuales carecen de un ingrediente computacional clave: la deformación representacional que ocurre en la IT debido a la adaptación, un mecanismo que vincula la dinámica neuronal con la percepción.
El estudio demuestra que la corteza IT sí integra el qué y el dónde de forma perceptualmente alineada, mientras que la IA actual, aunque puede codificar la posición, no funciona como la corteza IT porque no reproduce esta adaptación dinámica que es fundamental para nuestra experiencia visual.
La investigación identifica un ingrediente computacional por añadir que las redes actuales no logran reproducir: la deformación representacional inducida por la adaptación, un mecanismo que vincula la dinámica neuronal con la percepción.
1· Incorporar mecanismos de adaptación dinámica: La adaptación no es un simple ruido, sino un mecanismo funcional. Los modelos con adaptación muestran un rendimiento superior en reconocimiento de objetos dinámicos, mayor sensibilidad perceptual y una capacidad de representación más rápida en entornos visuales cambiantes. Redes recurrentes adaptativas como AdaptNet han logrado recapitular el fenómeno del post-efecto de movimiento (ilusión de la cascada), demostrando que procesan el movimiento de forma más eficiente y son más sensibles a los cambios.
2· Superar la limitación retinotópica y lograr alineación perceptual: Las redes actuales (feedforward, recurrentes y de video) codifican la posición de forma estática y retinotópica, pero fallan al reproducir los sesgos de posición inducidos por la adaptación que sí se observan en la IT y en humanos. El hallazgo de que aplicar transformaciones derivadas de la IT a las características de un modelo es suficiente para simular el efecto sugiere que la clave está en implementar operaciones de deformación sobre el espacio de representación, no solo en añadir capas.
3· Diseñar arquitecturas inspiradas en la modularidad cortical y el procesamiento predictivo: Los modelos monolíticos actuales, aunque potentes, carecen de la flexibilidad y adaptabilidad del cerebro. La corteza biológica organiza la percepción en módulos especializados que interactúan mediante bucles de retroalimentación predictiva y espacios latentes compartidos. Adoptar este principio podría dar lugar a sistemas más interpretables, robustos y capaces de generalizar mejor fuera de su distribución de entrenamiento.
Comentarios
Publicar un comentario