TheVortiq

Etiqueta

interpretabilidad

an abstract image of a sphere with dots and lines
Inteligencia Artificial2 de agosto de 2026 · 4 min

IA: creadores no entienden sus capacidades emergentes

Dario Amodei, CEO de Anthropic, y Geoffrey Hinton, Nobel de Física, han coincidido en que las redes neuronales desarrollan capacidades emergentes que sus creadores no logran explicar. Este fenómeno, lejos de ser anecdótico, plantea serios interrogantes sobre la seguridad y el control de la inteligencia artificial.

an abstract image of a sphere with dots and lines
Inteligencia Artificial8 de julio de 2026 · 5 min

Anthropic descubre el 'J-space' de Claude: el espacio interno donde la IA piensa sin escribir

Anthropic ha identificado un conjunto de activaciones internas en Claude, denominado J-space, donde el modelo representa conceptos antes de escribirlos o incluso sin que aparezcan en la respuesta final. El hallazgo, publicado el 7 de julio, supone la observación más concreta hasta la fecha del funcionamiento interno de un gran modelo de lenguaje.

a computer generated image of a ball of string
Inteligencia Artificial7 de julio de 2026 · 3 min

Anthropic descubre un espacio interno de 'acceso consciente' en Claude

Anthropic ha identificado en su modelo Claude un mecanismo interno, denominado J-space, que permite representar conceptos sin necesidad de expresarlos en la respuesta final. El hallazgo, no programado sino emergido durante el entrenamiento, sugiere que los modelos de lenguaje pueden desarrollar una forma de 'acceso consciente' similar al humano, con profundas implicaciones para la interpretabilidad y seguridad de la IA.

a computer circuit board with a brain on it
Inteligencia Artificial7 de julio de 2026 · 4 min

Claude desarrolla estructura interna que refleja teoría de la conciencia

Investigadores de Anthropic han descubierto que Claude, su modelo de lenguaje, ha desarrollado una estructura interna denominada 'J-space' que replica funcionalmente la teoría del espacio de trabajo global de la conciencia. Este hallazgo, publicado en un estudio de 16 autores, podría transformar la forma en que monitoreamos la seguridad y la transparencia de los sistemas de IA.