Arnés de IA (harness)
En una frase: el arnés es el programa que rodea al modelo para hacer tareas.
Tema avanzado
Esta ficha habla de herramientas para quien programa. Aquí tienes la idea; el detalle está en la versión adulta, enlazada al final.
El arnés decide qué información recibe el modelo, qué herramientas tiene y qué límites. También ejecuta lo que el modelo pide.
Claude Code y Codex llevan un arnés alrededor de su modelo. Lo que consigue un agente depende de los dos: el modelo y el arnés.
Es como un piloto de carreras: el resultado depende de él y de su coche.
Cómo se ve
Qué pasa, paso a paso
- El arnés reúne el contexto: instrucciones, datos y cómo va la tarea.
- Le pide al modelo el siguiente paso.
- Si el paso usa una herramienta permitida, el arnés la ejecuta. El modelo solo no ejecuta nada.
- El arnés le devuelve el resultado al modelo.
- Se repite hasta acabar la tarea o llegar a un punto de parada.
En 2022, un estudio llamado ReAct probó a mezclar razonar y actuar. Es una referencia para diseñar agentes. Pero no todos los bucles con herramientas funcionan igual que ReAct.
Las cinco piezas, según un vídeo
Nick Saraev, un creador de vídeos, ordena el arnés en cinco piezas. Es su forma de explicarlo, no una norma.
- Contexto: elegir las instrucciones, los datos y cómo va la tarea.
- Memoria: guardar notas y recuperar el trabajo hecho antes.
- Herramientas: hacer consultas y acciones.
- Verificación: comprobar los resultados, con fuentes, pruebas u otras herramientas.
- Permisos y sandbox: decidir qué acciones se permiten y dónde. Un sandbox es un espacio aislado.
Un ejemplo de la vida real
Piensa en hacer los deberes de matemáticas. Tu cabeza sería el modelo. El arnés, todo lo que te ayuda alrededor:
- El enunciado y lo que pide el profe: contexto.
- Lo que hiciste ayer en el cuaderno: memoria.
- La calculadora: herramienta.
- Las soluciones al final del libro: verificación.
- Levantar la mano antes de salir de clase: permisos.
Con la misma cabeza, el resultado depende también de esas ayudas.
Ejemplos oficiales
Claude Code, de Anthropic:
- El arnés le da herramientas al modelo y controla lo que ve. Su bucle mezcla reunir información, actuar y comprobar.
- Un archivo de instrucciones guarda las normas del proyecto.
- Cuando la conversación se acerca al límite, el arnés la recorta o la resume. Es la compactación.
- Un resumen puede perder detalles. Por eso las decisiones importantes conviene guardarlas en archivos.
- Otras piezas amplían el bucle, como MCP o los subagentes. Un subagente trabaja aparte y devuelve el resultado.
- Hay puntos de control para deshacer cambios en archivos. Lo hecho fuera, como enviar un correo, no se deshace.
Para tareas de varias sesiones, Anthropic mostró un arnés de ejemplo. Un primer agente lo prepara todo. Después se lleva un registro de lo hecho y una lista de funciones comprobadas. Es un diseño de ejemplo: no todos los agentes lo usan.
Codex, de OpenAI:
- Su arnés es abierto. Lleva el bucle, la conversación, las herramientas y las normas para ejecutar.
- La app, la terminal y el editor de código usan ese mismo arnés.
- Lee archivos de instrucciones generales y del proyecto. Los más cercanos a la carpeta de trabajo concretan las normas generales.
- El sandbox y las aprobaciones son controles distintos. El sandbox pone límites técnicos. Las aprobaciones deciden cuándo hace falta permiso.
- Tiene varios modos de sandbox. Uno de ellos no aísla nada.
Por qué importa
- Al comparar agentes en una prueba (benchmark), no mires solo el modelo. También cuentan las herramientas, las instrucciones, los intentos y la verificación.
- Una herramienta de comprobación ayuda si recibe los datos correctos. Una calculadora hace bien la cuenta. Pero no asegura que el agente eligiera bien los números, ni que entienda el resultado.
- Los permisos y el sandbox limitan lo que puede hacer, según cómo estén configurados. Escribir normas en las instrucciones no los sustituye.
- El vídeo dice que muchos avances vienen del arnés. Habla de estudios, pero no dice cuáles. Así que no está comprobado.
En la práctica
- Escribe en las instrucciones del proyecto el objetivo, los archivos importantes y cuándo está acabado.
- Elige bien cómo comprobar. Pruebas para el código. La fuente original para un dato. Revisar los datos antes de actuar.
- Guarda lo hecho y lo decidido fuera de la ventana de contexto. Así una tarea larga puede seguir otro día.
- Ajusta los permisos y el aislamiento a lo que necesita el trabajo. Las acciones hacia fuera necesitan su propio permiso.
Pruébalo tú
- Un agente quiere borrar la carpeta de fotos. ¿Qué piezas del arnés deberían protegerte?
- Un agente nuevo saca mejor nota en una prueba. ¿Seguro que su modelo es mejor?
Respuestas
- Los permisos, que deciden qué acciones se permiten. Y el sandbox, que limita dónde puede actuar. Escribir «no borres nada» en las instrucciones no basta.
- No necesariamente. La nota depende también de las herramientas, las instrucciones, los intentos y la verificación. No mide solo al modelo.
Palabras clave
- Arnés: programa que rodea al modelo y gestiona su contexto, herramientas y límites.
- Compactación: recortar o resumir una conversación larga para que siga cabiendo.
- Verificación: comprobar los resultados con fuentes, pruebas u otras herramientas.
- Sandbox: espacio aislado que pone límites técnicos a lo que hace el agente.
- Subagente: ayudante que trabaja aparte y devuelve el resultado al agente principal.
- Punto de control: copia que permite deshacer cambios en archivos.