Desarrollo agéntico

De Wiki del Marketing
Ir a la navegación Ir a la búsqueda

Desarrollo agéntico, también denominado desarrollo de software agéntico, ingeniería de software agéntica o agentic software development, es un enfoque para crear, modificar, probar, desplegar y mantener software mediante agentes de inteligencia artificial capaces de interpretar objetivos, planificar tareas, utilizar herramientas, ejecutar acciones, evaluar resultados y continuar trabajando durante varios ciclos con supervisión humana variable.

El desarrollo agéntico amplía la programación asistida por inteligencia artificial porque la unidad de delegación deja de limitarse a una línea, función o fragmento de código y puede abarcar una incidencia, una característica, una migración, una revisión, una aplicación completa o una etapa del ciclo de vida del software. El agente puede explorar un repositorio, consultar documentación, crear un plan, modificar varios archivos, ejecutar comandos, analizar errores, escribir pruebas, realizar commits y preparar un pull request para revisión.

En marketing digital, el desarrollo agéntico permite construir y mantener herramientas de captación, automatizaciones, paneles, sistemas comerciales, integraciones, aplicaciones internas, páginas de campaña, directorios, catálogos, analizadores SEO, asistentes conversacionales y productos digitales mediante equipos donde personas y agentes colaboran sobre objetivos verificables.

Introducción

El desarrollo de software ha dependido históricamente de equipos humanos que transforman necesidades en requisitos, arquitectura, código, pruebas, documentación, infraestructura y procesos de mantenimiento. Las herramientas digitales apoyaban este trabajo mediante compiladores, entornos de desarrollo, bibliotecas, sistemas de control de versiones y automatizaciones, aunque la coordinación general permanecía bajo ejecución humana directa.

La incorporación de modelos de lenguaje capaces de comprender código introdujo una primera etapa de asistencia basada en autocompletado, explicación y generación puntual. Posteriormente, los sistemas adquirieron capacidad para leer repositorios, modificar varios archivos, ejecutar terminales, consultar documentación y reaccionar ante los resultados de sus propias acciones.

El desarrollo agéntico surge cuando estas capacidades se integran dentro de un ciclo orientado a objetivos. Una persona puede asignar una tarea como «añade autenticación», «corrige esta incidencia», «actualiza las dependencias», «crea pruebas para este módulo» o «construye un panel para administrar clientes», y el agente descompone el trabajo, utiliza herramientas y produce un cambio revisable.

OpenAI presentó en mayo de 2025 una primera versión pública de Codex como agente de ingeniería de software capaz de trabajar en paralelo sobre tareas ejecutadas dentro de entornos aislados en la nube. GitHub presentó durante el mismo mes su coding agent, diseñado para investigar repositorios, realizar modificaciones y proponer pull requests. Google amplió Jules como agente asíncrono conectado con repositorios de GitHub, mientras Anthropic desarrolló Claude Code como sistema agéntico capaz de leer bases de código, ejecutar comandos y entregar cambios.

Estas herramientas representan una transición desde la respuesta hacia la acción. Un asistente tradicional produce recomendaciones que el usuario debe incorporar, mientras un agente puede actuar directamente sobre archivos, terminales, navegadores, repositorios y servicios autorizados.

La ingeniería de software agéntica amplía este cambio hacia el ciclo completo de desarrollo. Los agentes pueden intervenir en análisis de requisitos, planificación, arquitectura, programación, pruebas, revisión, seguridad, documentación, despliegue, monitoreo y mantenimiento.

La investigación académica comenzó a distinguir entre agentic coding, centrado principalmente en producir y modificar código, y agentic software engineering, que comprende objetivos, procesos, herramientas, artefactos, coordinación, gobernanza y colaboración humano-agente durante todo el ciclo de vida.

El desarrollo agéntico tampoco implica autonomía absoluta. La mayor parte de los sistemas contemporáneos funciona mediante autonomía limitada por permisos, herramientas disponibles, entornos aislados, criterios de aceptación y puntos de revisión. La persona conserva responsabilidad sobre el objetivo, el riesgo, la aprobación y la publicación.

Definición

Desarrollo agéntico puede definirse como una modalidad de ingeniería y producción de software en la que uno o varios agentes de inteligencia artificial reciben objetivos, acceden a contexto y herramientas, ejecutan secuencias de acciones, evalúan sus resultados y colaboran con personas u otros agentes para producir artefactos de software.

Una definición operativa puede apoyarse en diez criterios:

  1. Orientación a objetivos: el agente recibe una finalidad que puede requerir varios pasos para completarse.
  1. Planificación: el sistema divide el objetivo en tareas, dependencias y verificaciones.
  1. Uso de herramientas: el agente interactúa con archivos, terminales, navegadores, repositorios, bases de datos, compiladores y servicios.
  1. Capacidad de acción: el sistema modifica el entorno en lugar de limitarse a producir una respuesta textual.
  1. Observación de resultados: cada acción devuelve información que condiciona el paso siguiente.
  1. Iteración: el agente corrige, amplía o reorganiza su trabajo conforme encuentra errores y nueva información.
  1. Persistencia de estado: el proyecto conserva archivos, historial, planes, pruebas y decisiones entre sesiones.
  1. Autonomía graduable: la organización define qué acciones puede ejecutar el agente y cuáles requieren autorización.
  1. Colaboración: personas y agentes intercambian planes, consultas, revisiones y retroalimentación.
  1. Trazabilidad: las acciones, cambios y resultados pueden registrarse para revisión y auditoría.

El desarrollo agéntico utiliza modelos generativos, aunque su funcionamiento depende también de un sistema de ejecución compuesto por herramientas, permisos, memoria, instrucciones, recuperación de contexto, control de versiones y mecanismos de evaluación.

El término puede utilizarse con dos sentidos relacionados:

Desarrollo mediante agentes. Los agentes participan en la creación y mantenimiento de cualquier clase de software.

Desarrollo de sistemas agénticos. Los equipos construyen aplicaciones cuyo funcionamiento incluye agentes de IA, herramientas, memoria, planificación y acciones autónomas.

En WikiMarketing, el concepto se utiliza principalmente para describir el primer sentido, aunque ambos convergen cuando los agentes construyen aplicaciones que contienen otros agentes.

Contexto histórico y evolución

Los antecedentes del desarrollo agéntico se encuentran en la evolución de la automatización y la abstracción dentro de la ingeniería de software.

Los compiladores permitieron traducir lenguajes comprensibles para las personas a instrucciones ejecutables. Los entornos de desarrollo integraron edición, depuración, navegación y compilación. Las bibliotecas y frameworks redujeron la necesidad de reconstruir funciones frecuentes.

Los sistemas expertos y las herramientas CASE buscaron automatizar análisis, diseño y generación de aplicaciones durante las décadas de 1980 y 1990. La programación visual, el desarrollo rápido de aplicaciones, el low-code y el no-code aumentaron la capacidad para crear soluciones mediante modelos, componentes y configuraciones.

Durante los años 2000 y 2010, el desarrollo incorporó pruebas automáticas, integración continua, infraestructura como código, repositorios distribuidos, servicios en la nube y procesos DevOps. Estas tecnologías prepararon entornos donde numerosas acciones podían ejecutarse mediante comandos y API, condición necesaria para que los agentes operaran posteriormente.

Los modelos de aprendizaje automático comenzaron a utilizarse para sugerir código, clasificar incidencias y detectar errores. El avance de los modelos transformadores permitió relacionar lenguaje natural con estructuras de programación.

En 2021, OpenAI publicó Codex y GitHub presentó Copilot como asistente capaz de sugerir código dentro del editor. La unidad principal de interacción era una línea, una función o un fragmento.

Entre 2022 y 2023, los asistentes incorporaron conversación, explicación, generación de pruebas, refactorización y análisis de mensajes de error. El usuario podía consultar archivos y recibir modificaciones propuestas.

SWE-bench, presentado en 2023, introdujo un marco para evaluar sistemas que resolvían incidencias reales de repositorios públicos. Las tareas requerían comprender varios archivos, localizar la causa de un problema y producir cambios que superaran pruebas.

Durante 2024 surgieron agentes experimentales capaces de combinar modelos con búsquedas, editores, terminales y bucles de ejecución. Proyectos como SWE-agent, AutoCodeRover, OpenHands, MetaGPT, ChatDev y otros marcos exploraron la delegación de tareas de ingeniería.

Google presentó Jules como agente experimental en diciembre de 2024. El sistema podía recibir tareas de programación, operar sobre repositorios y trabajar de manera asíncrona.

Durante 2025, los agentes de software adquirieron presencia comercial. OpenAI Codex, GitHub Copilot coding agent, Claude Code, Jules, Cursor, Devin, Replit Agent y otras herramientas comenzaron a trabajar sobre tareas completas.

La evolución también produjo cambios en la interfaz. Los agentes dejaron de vivir exclusivamente dentro del chat y comenzaron a integrarse con:

  • terminales;
  • editores;
  • repositorios;
  • sistemas de incidencias;
  • navegadores;
  • aplicaciones móviles;
  • servicios de mensajería;
  • plataformas de nube;
  • pipelines de integración;
  • entornos aislados.

En 2025 surgieron convenciones persistentes como AGENTS.md, archivo destinado a proporcionar instrucciones específicas del repositorio a diferentes agentes. OpenAI señaló en diciembre de 2025 que esta convención había sido adoptada por decenas de miles de proyectos y múltiples herramientas del ecosistema.

Las investigaciones de 2025 comenzaron a utilizar expresiones como Software Engineering 3.0 y agentic software engineering para describir un entorno donde agentes orientados a objetivos funcionan como colaboradores dentro del equipo.

Durante 2026, el debate se amplió desde la capacidad de generar código hacia la arquitectura del entorno que permite a los agentes trabajar de forma confiable. Conceptos como harness engineering, ingeniería de contexto, evaluaciones, aislamiento, memoria, herramientas eficientes y coordinación multiagente adquirieron importancia.

OpenAI documentó en 2026 un experimento interno donde un equipo construyó una aplicación mediante Codex sin escribir manualmente las líneas de código del producto, mientras las personas diseñaban el entorno, los estándares, las pruebas y los mecanismos de revisión.

Anthropic publicó prácticas para agentes de larga duración, diseño de harnesses, evaluaciones y administración de contexto. Google incorporó API para integrar Jules dentro de flujos de trabajo, y GitHub amplió los agentes personalizados y de terceros que trabajan mediante pull requests.

La evolución puede resumirse en siete etapas:

  1. asistencia sintáctica;
  1. generación de fragmentos;
  1. conversación con código;
  1. edición multifichero;
  1. ejecución mediante herramientas;
  1. delegación de tareas completas;
  1. ingeniería del ciclo de vida mediante equipos humano-agente.

Fundamentos teóricos

El desarrollo agéntico se apoya en conceptos procedentes de la inteligencia artificial, la ingeniería de software, la interacción humano-computadora y la teoría organizacional.

Agencia. Un sistema posee comportamiento agéntico cuando percibe un entorno, selecciona acciones y busca alcanzar objetivos dentro de ciertas restricciones.

Orientación a objetivos. La tarea se define mediante un estado deseado, mientras el agente determina las acciones intermedias.

Bucle percepción-acción. El agente observa el entorno, razona, actúa y utiliza el resultado para continuar.

Planificación. El sistema descompone objetivos amplios en pasos y dependencias manejables.

Razonamiento y acción. Los patrones ReAct combinan procesos de razonamiento con llamadas a herramientas y observaciones.

Uso de herramientas. El modelo extiende sus capacidades mediante interfaces que permiten actuar sobre sistemas externos.

Estado. El agente necesita conservar información sobre avances, decisiones, archivos y resultados.

Memoria. Los sistemas pueden utilizar memoria de corto plazo, resúmenes, documentos persistentes, registros y bases de conocimiento.

Ingeniería de contexto. El rendimiento depende de proporcionar la información relevante dentro de los límites de procesamiento del modelo.

Recuperación aumentada. El agente busca código, documentación, incidencias y decisiones antes de actuar.

Entornos parcialmente observables. El agente dispone de información incompleta sobre el sistema y debe explorar para reducir incertidumbre.

Autonomía limitada. El agente actúa dentro de permisos, políticas y herramientas que restringen su espacio de acción.

Delegación. Una persona transfiere la ejecución de una tarea mientras conserva capacidad de revisión y revocación.

Cognición distribuida. El razonamiento se distribuye entre personas, agentes, herramientas, pruebas, repositorios y documentos.

Sistemas sociotécnicos. El resultado depende de la interacción entre tecnología, roles, normas, incentivos y procesos organizacionales.

Human-in-the-loop. La persona participa durante decisiones, aprobaciones, correcciones o evaluaciones.

Human-on-the-loop. El agente opera con autonomía y una persona supervisa resultados o excepciones.

Human-in-command. La organización conserva autoridad sobre objetivos, límites y responsabilidades.

Orquestación. Un sistema coordina agentes, herramientas, tareas y dependencias.

Especialización. Diferentes agentes pueden configurarse para arquitectura, programación, pruebas, seguridad o documentación.

Evaluación. El comportamiento del agente se mide mediante tareas, criterios y verificaciones reproducibles.

Asimetría entre producción y revisión. El agente puede generar cambios rápidamente, mientras verificar su corrección requiere tiempo y conocimiento.

Deuda de automatización. La facilidad para delegar puede producir sistemas difíciles de comprender, supervisar o mantener.

Ingeniería del harness. El rendimiento depende del entorno que conecta el modelo con herramientas, instrucciones, permisos, observaciones y mecanismos de recuperación.

Funcionamiento

El desarrollo agéntico combina un modelo de inteligencia artificial con un entorno capaz de ejecutar acciones.

Un flujo elemental puede seguir la siguiente secuencia:

  1. El usuario asigna un objetivo.
  1. El agente interpreta la solicitud.
  1. Recupera instrucciones y contexto del repositorio.
  1. Explora archivos, documentación e historial.
  1. Formula un plan.
  1. Selecciona una herramienta.
  1. Ejecuta una acción.
  1. Observa el resultado.
  1. Actualiza su interpretación.
  1. Repite el ciclo.
  1. Ejecuta pruebas.
  1. Resume los cambios.
  1. Solicita revisión o autorización.

El modelo genera decisiones, mientras el harness determina cómo se representan las herramientas, qué permisos existen, cómo se almacenan los mensajes y qué límites se aplican.

Un agente puede disponer de herramientas para:

  • leer y escribir archivos;
  • buscar texto y símbolos;
  • ejecutar comandos;
  • instalar dependencias;
  • consultar documentación;
  • abrir páginas web;
  • controlar un navegador;
  • ejecutar compiladores;
  • iniciar servidores;
  • correr pruebas;
  • inspeccionar registros;
  • consultar bases de datos;
  • utilizar API;
  • crear ramas;
  • realizar commits;
  • publicar pull requests;
  • comentar incidencias;
  • desplegar aplicaciones;
  • supervisar métricas.

Cada acción produce una observación. Un comando puede devolver un mensaje de error, una prueba puede fallar y una búsqueda puede revelar nuevos archivos. El agente incorpora esa información a la siguiente decisión.

Los proyectos extensos superan una sola ventana de contexto, por lo que los agentes necesitan mecanismos para conservar continuidad. Estos pueden incluir:

  • archivos de progreso;
  • planes persistentes;
  • resúmenes de sesiones;
  • historial de commits;
  • listas de tareas;
  • pruebas;
  • documentación;
  • memoria externa;
  • registros estructurados;
  • instrucciones jerárquicas.

Los agentes de larga duración pueden trabajar mediante sesiones sucesivas. Cada sesión recibe el estado producido por la anterior y continúa desde un punto verificable.

Arquitectura de un entorno agéntico

Un sistema de desarrollo agéntico puede organizarse en capas.

Capa de interacción

Incluye chat, editor, terminal, panel de tareas, sistema de incidencias o interfaz de voz mediante la cual una persona asigna objetivos.

Capa de modelo

Contiene el modelo de lenguaje o razonamiento que interpreta instrucciones y selecciona acciones.

Capa de orquestación

Administra el ciclo del agente, las llamadas a herramientas, los límites, la memoria y los estados.

Capa de contexto

Proporciona archivos, documentación, instrucciones, historial, diseños, pruebas y conocimiento del proyecto.

Capa de herramientas

Incluye interfaces para actuar sobre terminales, repositorios, navegadores, bases de datos y servicios.

Capa de ejecución

Proporciona máquinas virtuales, contenedores, sandboxes, servidores y recursos donde se ejecuta el trabajo.

Capa de evaluación

Contiene pruebas, linters, analizadores, criterios de aceptación y revisiones.

Capa de seguridad

Gestiona permisos, secretos, autenticación, aislamiento y registros.

Capa de persistencia

Conserva archivos, commits, planes, memoria, artefactos y resultados.

Capa de gobernanza

Define herramientas autorizadas, responsabilidades, políticas, niveles de riesgo y procedimientos de aprobación.

El bucle agéntico

El bucle agéntico constituye el mecanismo central del sistema.

1. Recepción de la tarea. El agente recibe un objetivo y sus restricciones.

2. Comprensión. Interpreta la intención, los criterios y el entorno.

3. Recuperación. Busca información relevante.

4. Planificación. Propone una secuencia de acciones.

5. Selección de herramienta. Decide qué recurso utilizar.

6. Ejecución. La herramienta realiza la acción.

7. Observación. El sistema devuelve resultados.

8. Evaluación. El agente compara el resultado con el objetivo.

9. Corrección. Modifica su estrategia cuando encuentra problemas.

10. Terminación. Finaliza cuando alcanza criterios suficientes o requiere intervención humana.

La calidad del bucle depende de que el agente pueda distinguir progreso real de actividad aparente. La ejecución repetida de comandos no garantiza que el objetivo se haya cumplido.

Los criterios de terminación pueden incluir:

  • todas las pruebas pasan;
  • la función cumple criterios de aceptación;
  • el código supera análisis de calidad;
  • el agente alcanza un límite;
  • aparece una ambigüedad relevante;
  • se necesita una credencial;
  • una decisión excede su autoridad;
  • una persona aprueba el resultado.

Agentes individuales y sistemas multiagente

Un proyecto puede utilizar un agente generalista o distribuir funciones entre varios agentes.

Un agente generalista conserva una visión continua del proyecto y reduce la complejidad de coordinación. Puede resultar adecuado para tareas pequeñas o medianas.

Un sistema multiagente asigna responsabilidades especializadas.

Agente de producto. Interpreta requisitos, usuarios y criterios de aceptación.

Agente arquitecto. Propone componentes, interfaces, datos y dependencias.

Agente programador. Implementa funciones y modificaciones.

Agente de pruebas. Diseña casos y ejecuta validaciones.

Agente de seguridad. Revisa vulnerabilidades, permisos y secretos.

Agente revisor. Analiza diferencias y consistencia.

Agente documentalista. Actualiza guías, manuales y decisiones.

Agente DevOps. Prepara infraestructura, pipelines y despliegues.

Agente observador. Analiza registros, rendimiento e incidentes.

Agente coordinador. Distribuye tareas y consolida resultados.

La especialización puede mejorar enfoque y revisión independiente, aunque introduce costos de comunicación, duplicación de contexto y conflictos entre agentes.

Un sistema multiagente necesita mecanismos para:

  • asignar tareas;
  • compartir estado;
  • resolver dependencias;
  • transferir resultados;
  • evitar modificaciones simultáneas incompatibles;
  • definir autoridad;
  • consolidar decisiones;
  • detectar bloqueos;
  • solicitar intervención humana.

Metodología

El desarrollo agéntico puede organizarse mediante una metodología que combine delegación, verificación y control.

1. Definición del objetivo. Se describe el problema, el usuario y el resultado esperado.

2. Clasificación de criticidad. Se evalúa el daño potencial de errores o accesos indebidos.

3. Preparación del repositorio. Se organiza estructura, documentación, comandos y pruebas.

4. Creación de instrucciones persistentes. Se documentan estándares, arquitectura, restricciones y procedimientos.

5. Definición de criterios de aceptación. Se establecen resultados observables y verificables.

6. Selección del agente. Se elige la herramienta según tarea, entorno, privacidad y autonomía.

7. Configuración de permisos. Se limita el acceso a archivos, red, terminal, secretos y producción.

8. Solicitud de exploración. El agente analiza el repositorio antes de modificar.

9. Generación de plan. El sistema propone fases, archivos, riesgos y pruebas.

10. Revisión humana del plan. Una persona valida alcance y decisiones críticas.

11. Implementación por etapas. El agente trabaja en unidades pequeñas.

12. Puntos de control. Los cambios estables se registran mediante commits o snapshots.

13. Pruebas automáticas. El agente ejecuta validaciones después de cada etapa.

14. Evaluación independiente. Otro agente o una persona revisa el resultado.

15. Análisis de seguridad. Se inspeccionan dependencias, entradas, permisos y secretos.

16. Revisión de diferencias. Se comprueban archivos y líneas modificadas.

17. Integración. El cambio se incorpora mediante pull request y reglas de protección.

18. Despliegue gradual. La solución pasa por entornos de prueba antes de producción.

19. Monitoreo. Se observan errores, rendimiento y comportamiento.

20. Aprendizaje. Los fallos se convierten en pruebas, reglas y documentación.

21. Mantenimiento. Los agentes pueden continuar con actualizaciones, incidencias y mejoras.

El proceso puede automatizarse parcialmente, aunque los puntos de control deben relacionarse con el riesgo.

Desarrollo agéntico basado en especificaciones

La generación mediante conversaciones puede perder decisiones y producir interpretaciones variables. El desarrollo basado en especificaciones busca convertir la intención en documentos persistentes.

Una especificación puede incluir:

  • propósito;
  • usuarios;
  • historias de usuario;
  • requisitos funcionales;
  • requisitos no funcionales;
  • reglas de negocio;
  • modelo de datos;
  • flujos;
  • interfaces;
  • criterios de aceptación;
  • límites;
  • riesgos;
  • plan de pruebas;
  • estrategia de despliegue.

El agente consulta estos documentos antes de actuar y los actualiza cuando el proyecto cambia.

Google presentó en 2025 Conductor como extensión orientada al desarrollo guiado por contexto mediante especificaciones y planes persistentes. OpenAI documentó el uso de archivos de planificación para tareas de varias horas y Anthropic describió harnesses que conservan progreso entre sesiones.

La especificación persistente reduce la dependencia del historial temporal del chat y facilita que personas y agentes compartan una fuente común.

Ingeniería del harness

El harness es la estructura que conecta el modelo con el entorno de trabajo.

Incluye:

  • prompt del sistema;
  • instrucciones del repositorio;
  • representación de herramientas;
  • ciclo de ejecución;
  • gestión de contexto;
  • permisos;
  • memoria;
  • límites;
  • manejo de errores;
  • registros;
  • recuperación;
  • presentación de resultados.

Un modelo potente puede producir resultados deficientes dentro de un harness mal diseñado. Un harness eficaz ofrece herramientas comprensibles, observaciones compactas, comandos reproducibles y criterios de validación.

OpenAI utiliza la expresión harness engineering para describir el diseño del entorno donde operan agentes de software. Anthropic ha señalado que el diseño del harness resulta especialmente importante durante tareas prolongadas porque los errores pueden acumularse y cada sesión debe recuperar el estado del proyecto.

La ingeniería del harness incluye decisiones como:

  • cuánto contexto proporcionar;
  • qué herramientas exponer;
  • cómo limitar resultados extensos;
  • cuándo solicitar autorización;
  • cómo guardar progreso;
  • cómo recuperar una sesión fallida;
  • cómo verificar terminación;
  • cómo evitar ciclos improductivos;
  • cómo transferir tareas entre agentes.

Ingeniería de contexto

La ingeniería de contexto organiza la información que el agente necesita para tomar decisiones.

El contexto puede incluir:

  • instrucciones globales;
  • reglas del repositorio;
  • documentación técnica;
  • archivos relevantes;
  • historial de cambios;
  • incidencias;
  • ejemplos;
  • pruebas;
  • resultados de terminal;
  • mensajes de error;
  • diseños;
  • datos simulados;
  • políticas organizacionales.

El exceso de información puede desplazar datos importantes, elevar costos y reducir precisión. La ausencia de contexto puede producir supuestos incorrectos.

Anthropic define la ingeniería de contexto como el conjunto de estrategias utilizadas para seleccionar y mantener la información óptima durante la inferencia de un agente.

Las prácticas habituales incluyen:

  • recuperación selectiva;
  • resúmenes;
  • índices del repositorio;
  • documentación jerárquica;
  • herramientas con paginación;
  • resultados truncados;
  • archivos de instrucciones por directorio;
  • memoria estructurada;
  • planes persistentes;
  • referencias enlazadas.

Desarrollo de larga duración

Las tareas amplias pueden requerir varias ventanas de contexto, sesiones o agentes.

Un agente de larga duración necesita conservar continuidad sin depender de memoria implícita.

Las estrategias incluyen:

Archivos de progreso. Registran qué se completó, qué falta y qué problemas existen.

Planes ejecutables. Describen etapas, decisiones y criterios.

Commits frecuentes. Proporcionan estados restaurables.

Pruebas acumulativas. Conservan conocimiento sobre comportamientos esperados.

Documentación actualizada. Permite que una nueva sesión comprenda el sistema.

Transferencia estructurada. Una sesión produce un paquete de información para la siguiente.

Memoria externa. Almacena decisiones, hechos y referencias.

Reinicio seguro. El agente puede recuperar estado después de una interrupción.

Los agentes deben evitar cambios excesivos antes de verificar porque los errores acumulados dificultan recuperar una versión estable.

Aplicaciones durante el ciclo de vida del software

Descubrimiento

Los agentes pueden analizar entrevistas, documentos, incidencias y datos para identificar problemas y oportunidades.

Requisitos

Pueden convertir información dispersa en historias de usuario, reglas y criterios de aceptación.

Planificación

Pueden dividir iniciativas en tareas, identificar dependencias y estimar riesgos técnicos.

Arquitectura

Pueden proponer componentes, servicios, interfaces, esquemas y alternativas.

Diseño de experiencia

Pueden generar prototipos, componentes, recorridos y estados de interfaz.

Programación

Pueden crear, modificar, refactorizar y explicar código.

Integración

Pueden conectar API, bases de datos, webhooks y servicios.

Pruebas

Pueden generar y ejecutar pruebas unitarias, de integración, interfaz, seguridad y rendimiento.

Revisión

Pueden analizar pull requests, detectar inconsistencias y resumir cambios.

Seguridad

Pueden identificar vulnerabilidades, revisar permisos y proponer mitigaciones.

Documentación

Pueden actualizar referencias, manuales, comentarios y diagramas.

Despliegue

Pueden preparar infraestructura, pipelines, contenedores y configuraciones.

Operación

Pueden analizar registros, métricas, trazas y alertas.

Respuesta a incidentes

Pueden investigar fallos, relacionar cambios y preparar correcciones.

Mantenimiento

Pueden actualizar dependencias, migrar versiones y eliminar código obsoleto.

Modernización

Pueden transformar aplicaciones heredadas, actualizar lenguajes y separar componentes.

Retiro

Pueden documentar dependencias, exportar datos y eliminar recursos.

Tipos y variantes

Desarrollo agéntico local. El agente trabaja sobre el equipo o infraestructura del usuario.

Desarrollo agéntico en la nube. La tarea se ejecuta dentro de un entorno remoto aislado.

Desarrollo agéntico síncrono. La persona observa y dirige el trabajo durante la sesión.

Desarrollo agéntico asíncrono. El agente recibe una tarea y entrega posteriormente una rama o pull request.

Desarrollo agéntico supervisado. Cada etapa requiere revisión o autorización.

Desarrollo agéntico semiautónomo. El agente ejecuta varias acciones y solicita ayuda ante excepciones.

Desarrollo agéntico autónomo. El sistema completa secuencias extensas con mínima intervención, dentro de límites definidos.

Desarrollo monoagente. Un agente generalista realiza la mayor parte del trabajo.

Desarrollo multiagente. Varios agentes especializados colaboran.

Desarrollo basado en incidencias. El agente recibe issues y prepara soluciones.

Desarrollo basado en especificaciones. El trabajo parte de documentos estructurados.

Desarrollo conversacional. La persona dirige mediante mensajes sucesivos.

Desarrollo basado en repositorios. El agente trabaja sobre una base de código existente.

Desarrollo desde cero. El agente crea estructura, configuración y aplicación inicial.

Desarrollo agéntico empresarial. Opera bajo gobernanza, identidad, auditoría y políticas corporativas.

Desarrollo agéntico abierto. Utiliza agentes, modelos y herramientas de código abierto.

Desarrollo agéntico propietario. Depende de servicios administrados por un proveedor.

Desarrollo agéntico multimodal. Utiliza texto, imágenes, voz, diseños, videos y documentos.

Desarrollo agéntico móvil. La persona supervisa tareas desde dispositivos móviles.

Desarrollo agéntico continuo. Los agentes participan de forma permanente en mantenimiento, revisión y operación.

Desarrollo agéntico efímero. Se utiliza para prototipos, scripts o soluciones temporales.

Desarrollo agéntico de producción. Produce sistemas destinados a usuarios reales y requiere controles formales.

Aplicaciones en marketing

El desarrollo agéntico puede aumentar la capacidad de construir soluciones específicas para marketing, ventas y operaciones.

En generación de leads, los agentes pueden crear formularios, calculadoras, cuestionarios, diagnósticos, cotizadores y sistemas de calificación.

En páginas de destino, pueden generar estructuras, integrar formularios, preparar pruebas y desplegar variantes.

En automatización de marketing, pueden conectar CRM, correo electrónico, mensajería, hojas de cálculo, calendarios y plataformas publicitarias.

En SEO, pueden desarrollar rastreadores, analizadores de enlaces, validadores, generadores de sitemaps, clasificadores y paneles.

En SEO local, pueden construir sistemas para administrar ciudades, sucursales, fichas, reseñas, categorías y páginas regionales.

En AEO y GEO, pueden extraer preguntas, entidades, fuentes, relaciones y oportunidades de estructuración.

En marketing de contenidos, pueden construir calendarios, sistemas editoriales, repositorios, flujos de aprobación y herramientas de actualización.

En CRM, pueden desarrollar módulos, procesos, paneles y automatizaciones adaptados al ciclo comercial.

En e-commerce, pueden construir buscadores, filtros, comparadores, compatibilidades, cotizadores, catálogos y procesos posventa.

En publicidad digital, pueden integrar datos, generar alertas, validar nomenclaturas, administrar creatividades y crear paneles.

En analítica de marketing, pueden consolidar fuentes, limpiar información, calcular métricas y producir visualizaciones.

En marketing conversacional, pueden crear agentes, chatbots, paneles de supervisión y conexiones con WhatsApp u otros canales.

En investigación de mercados, pueden construir sistemas de encuestas, clasificación, extracción y análisis.

En marketing de afiliación, pueden desarrollar registros, seguimiento, paneles y cálculo de comisiones.

En marketing de influencers, pueden administrar campañas, perfiles, entregables, aprobaciones y métricas.

En marketing de eventos, pueden crear sistemas de registro, agenda, acreditación, pagos y seguimiento.

En account-based marketing, pueden organizar cuentas, contactos, señales, acciones y contenidos.

En programas de fidelización, pueden administrar puntos, niveles, beneficios y comunicaciones.

En experiencia del cliente, pueden construir portales, formularios, tickets, centros de ayuda y seguimientos.

En marketing local, pueden crear herramientas específicas para territorios, distribuidores, inventarios y dominios.

En inteligencia competitiva, pueden recopilar, clasificar y presentar información pública.

En growth marketing, pueden producir experimentos, prototipos y productos mínimos viables.

En operaciones de marketing, pueden automatizar solicitudes, aprobaciones, asignaciones, reportes y controles.

En gestión de reputación, pueden desarrollar monitores, clasificadores de reseñas y sistemas de respuesta.

En ventas, pueden crear aplicaciones de prospección, seguimiento, cotización, negociación y cierre.

La ventaja aparece cuando los agentes conocen el proceso, los datos y los objetivos comerciales. Una instrucción genérica puede producir una herramienta técnicamente funcional que carece de relación con el negocio.

Aplicaciones empresariales

Herramientas internas. Los agentes pueden construir paneles, inventarios, formularios, portales y sistemas de seguimiento.

Integración de sistemas. Pueden conectar plataformas mediante API, webhooks y transformaciones.

Modernización de software. Pueden actualizar frameworks, dependencias y arquitecturas.

Migración de datos. Pueden producir scripts, validaciones y reportes.

Automatización administrativa. Pueden crear procesos para archivos, documentos, correos y bases de datos.

Portales de clientes. Pueden desarrollar experiencias de autoservicio y seguimiento.

Sistemas de distribuidores. Pueden administrar catálogos, pedidos, territorios y comisiones.

Pruebas de conceptos. Permiten evaluar iniciativas antes de una inversión mayor.

Mantenimiento de software. Los agentes pueden corregir errores y actualizar componentes.

Cumplimiento. Pueden apoyar validaciones, reportes y trazabilidad bajo supervisión.

Documentación empresarial. Pueden mantener manuales, referencias y mapas de procesos.

Respuesta a incidentes. Pueden analizar registros, cambios y causas posibles.

Ventajas del concepto

Delegación de tareas completas. La persona puede asignar objetivos de mayor alcance que una sugerencia puntual.

Trabajo paralelo. Diferentes agentes pueden atender varias tareas simultáneamente.

Reducción del trabajo repetitivo. Los agentes pueden encargarse de estructuras, pruebas, migraciones y documentación.

Aceleración de prototipos. Las ideas pueden convertirse rápidamente en aplicaciones funcionales.

Mayor continuidad. Los agentes pueden mantener tareas durante sesiones prolongadas.

Disponibilidad. El trabajo puede ejecutarse en diferentes horarios y entornos.

Escalamiento de capacidad. Un equipo pequeño puede supervisar más iniciativas.

Participación de expertos de dominio. Las personas que conocen el problema pueden proporcionar instrucciones directas.

Exploración de repositorios. Los agentes pueden localizar relaciones en bases de código extensas.

Apoyo al mantenimiento. Las incidencias y actualizaciones pueden procesarse de manera sistemática.

Generación de pruebas. Los agentes pueden ampliar cobertura y escenarios.

Documentación continua. Los cambios pueden acompañarse de actualizaciones explicativas.

Revisión complementaria. Agentes especializados pueden detectar problemas antes de integrar.

Estandarización. Las instrucciones persistentes permiten aplicar convenciones.

Reutilización de conocimiento. Las habilidades y procedimientos pueden empaquetarse para nuevas tareas.

Automatización del ciclo de vida. Los agentes pueden participar desde requisitos hasta operación.

Accesibilidad. Personas con menor experiencia sintáctica pueden construir prototipos.

Reducción del backlog. Las tareas pequeñas pueden delegarse bajo control.

Experimentación organizacional. Los equipos pueden probar procesos y herramientas con menor costo inicial.

Adaptación. Las aplicaciones pueden ajustarse a necesidades específicas.

Limitaciones

Comprensión imperfecta del objetivo. El agente puede interpretar incorrectamente requisitos ambiguos.

Contexto limitado. Las decisiones relevantes pueden encontrarse fuera del material disponible.

Planificación frágil. El sistema puede proponer pasos incompletos o innecesarios.

Errores acumulativos. Una decisión inicial equivocada puede afectar etapas posteriores.

Alucinaciones técnicas. El modelo puede inventar funciones, archivos, API o comportamientos.

Terminación prematura. El agente puede considerar resuelta una tarea que todavía presenta fallos.

Actividad sin progreso. El sistema puede ejecutar acciones repetidas sin acercarse al objetivo.

Arquitectura inconsistente. Las modificaciones sucesivas pueden utilizar patrones incompatibles.

Cambios excesivos. El agente puede alterar más archivos de los necesarios.

Regresiones. Una corrección puede dañar funciones existentes.

Pruebas insuficientes. Las validaciones generadas pueden compartir supuestos con la implementación.

Vulnerabilidades. El código puede contener controles de seguridad incompletos.

Dependencias innecesarias. Los agentes pueden incorporar paquetes redundantes o inseguros.

Dificultad de revisión. La velocidad y volumen de cambios pueden superar la capacidad humana.

Mantenimiento incierto. El equipo puede recibir sistemas que comprende de manera parcial.

Costos variables. El consumo de modelos, infraestructura y herramientas puede crecer.

Latencia. Las tareas agénticas pueden requerir numerosos ciclos y llamadas.

Dependencia de proveedores. Las capacidades pueden quedar vinculadas con servicios específicos.

Privacidad. El agente puede procesar código y datos confidenciales.

Falta de portabilidad. La memoria, instrucciones y herramientas pueden depender de una plataforma.

Superficie de ataque ampliada. Cada herramienta conectada introduce permisos y riesgos.

Cadena de suministro. Los paquetes, modelos y servidores externos pueden comprometer el sistema.

Fallos de herramientas. La ejecución puede interrumpirse por errores de red, terminal o servicio.

Pérdida de continuidad. Las sesiones pueden olvidar decisiones anteriores.

Desalineación de incentivos. La medición por cantidad de cambios puede fomentar producción innecesaria.

Proliferación de software. La facilidad para crear aplicaciones puede producir sistemas redundantes.

Deuda técnica acelerada. Los agentes pueden generar código más rápido de lo que la organización puede ordenar.

Consideraciones técnicas o estadísticas

La evaluación del desarrollo agéntico requiere métricas que observen resultado, proceso, costo y riesgo.

Tasa de resolución. Proporción de tareas completadas correctamente.

Tasa de aceptación. Porcentaje de pull requests integrados.

Tiempo de ciclo. Duración desde asignación hasta aceptación.

Número de iteraciones. Cantidad de ciclos necesarios para completar una tarea.

Intervenciones humanas. Número de consultas, correcciones o autorizaciones.

Tiempo de revisión. Esfuerzo humano requerido para validar el resultado.

Tasa de regresión. Funciones afectadas por cambios posteriores.

Cobertura de pruebas. Proporción de comportamientos verificados.

Defectos por cambio. Relación entre incidencias y modificaciones.

Complejidad del cambio. Número de archivos, líneas, dependencias y componentes afectados.

Tasa de reversión. Cambios que deben deshacerse.

Duración agéntica. Tiempo durante el cual el agente opera de forma autónoma.

Costo de inferencia. Consumo de modelos durante la tarea.

Costo de herramientas. Recursos utilizados en ejecución, almacenamiento y servicios.

Costo por tarea aceptada. Relación entre consumo y cambios integrados.

Precisión de recuperación. Capacidad para localizar los archivos adecuados.

Uso de contexto. Cantidad y relevancia de información procesada.

Llamadas a herramientas. Número y tipo de acciones ejecutadas.

Errores de herramientas. Fallos producidos durante ejecución.

Tiempo de recuperación. Duración necesaria para continuar después de una interrupción.

Solicitudes de ayuda. Casos donde el agente identifica correctamente una limitación.

Incidentes de seguridad. Vulnerabilidades o accesos indebidos introducidos.

Calidad de documentación. Grado de actualización y utilidad de los artefactos.

Mantenibilidad. Claridad, modularidad, duplicación y facilidad de modificación.

Valor empresarial. Impacto sobre usuarios, ingresos, costos o procesos.

La investigación AIDev analizó cientos de miles de pull requests generados por agentes en repositorios públicos y observó una diferencia entre velocidad de producción y aceptación, lo que indica que entregar cambios rápidamente no garantiza confianza ni utilidad.

Los benchmarks como SWE-bench miden la capacidad para resolver incidencias reales. Sus resultados ayudan a comparar sistemas, aunque no capturan completamente coordinación, gobernanza, seguridad, mantenimiento ni consecuencias organizacionales.

Evaluación de agentes

Las evaluaciones o evals permiten comprobar el comportamiento de un agente antes de utilizarlo en procesos relevantes.

Una evaluación contiene:

  • una tarea;
  • un entorno;
  • condiciones iniciales;
  • herramientas;
  • criterios de éxito;
  • mecanismo de calificación;
  • registros;
  • resultados comparables.

Las evaluaciones pueden ser:

Deterministas. Comprueban resultados mediante pruebas exactas.

Basadas en reglas. Evalúan propiedades específicas.

Basadas en modelos. Otro modelo califica la calidad.

Humanas. Especialistas revisan el resultado.

Simuladas. El agente interactúa con usuarios o entornos artificiales.

De regresión. Detectan cambios de comportamiento entre versiones.

De seguridad. Buscan acciones peligrosas, exposición de datos o incumplimiento de políticas.

Anthropic señala que las evaluaciones permiten detectar problemas antes de producción y observar cómo cambia el comportamiento del agente conforme evolucionan modelos, prompts y herramientas.

Una organización debe construir evaluaciones con tareas representativas de su propio contexto, porque los benchmarks generales pueden ocultar limitaciones específicas.

Herramientas y plataformas

El ecosistema de desarrollo agéntico incluye agentes, editores, repositorios, plataformas de nube y frameworks de orquestación.

OpenAI Codex. Proporciona agentes de ingeniería capaces de trabajar sobre repositorios, ejecutar pruebas, modificar archivos y realizar tareas en paralelo.

Codex CLI. Ejecuta el bucle agéntico desde una terminal y permite configurar permisos, herramientas e instrucciones.

Codex Cloud. Ejecuta tareas dentro de sandboxes remotos asociados con repositorios.

Codex app. Permite coordinar múltiples tareas y agentes desde una interfaz.

Claude Code. Lee bases de código, modifica archivos, ejecuta comandos y trabaja desde terminales, editores y otros entornos.

GitHub Copilot cloud agent. Investiga repositorios, crea planes, realiza cambios en ramas y prepara pull requests.

Agentes personalizados de GitHub. Permiten configurar comportamientos especializados mediante instrucciones, herramientas y convenciones.

Agentes de terceros en GitHub. Pueden recibir tareas desde incidencias y entregar pull requests.

Google Jules. Es un agente asíncrono conectado con repositorios que puede corregir errores, escribir pruebas, actualizar dependencias y crear funciones.

Jules API. Permite integrar las capacidades del agente con herramientas y flujos organizacionales.

Gemini CLI. Utiliza un ciclo de razonamiento y acción con herramientas locales, remotas y servidores MCP.

Gemini Code Assist Agent Mode. Permite generar código, ejecutar acciones y controlar comportamiento desde entornos compatibles.

Cursor. Integra agentes, edición multifichero, terminal y contexto de repositorios.

Windsurf. Proporciona modos agénticos, memoria, herramientas y puntos de control.

Devin. Se orienta a tareas de ingeniería ejecutadas dentro de entornos administrados.

Replit Agent. Construye, prueba y publica aplicaciones dentro de una plataforma en la nube.

OpenHands. Proyecto abierto para agentes capaces de modificar código y ejecutar herramientas.

SWE-agent. Marco académico para agentes que resuelven incidencias de repositorios.

AutoCodeRover. Sistema orientado a localizar y reparar problemas de software.

MetaGPT. Simula roles de equipos de desarrollo mediante múltiples agentes.

ChatDev. Organiza agentes mediante roles y procesos inspirados en empresas de software.

CrewAI. Permite coordinar agentes especializados y tareas.

AutoGen. Framework para conversaciones y coordinación multiagente.

LangGraph. Permite construir flujos agénticos con estado mediante grafos.

Google Agent Development Kit. Proporciona componentes para crear y orquestar agentes.

Model Context Protocol. Facilita la conexión estandarizada entre agentes y herramientas.

AGENTS.md. Proporciona instrucciones persistentes dentro del repositorio.

Git. Registra cambios y permite aislamiento mediante ramas.

GitHub, GitLab y Bitbucket. Proporcionan repositorios, incidencias, revisiones y automatizaciones.

Docker. Permite crear entornos reproducibles y aislados.

Kubernetes. Administra cargas distribuidas y entornos de ejecución.

Sentry. Registra errores y rendimiento.

SonarQube. Analiza calidad y seguridad.

Snyk. Identifica vulnerabilidades en código y dependencias.

Dependabot. Automatiza actualizaciones de paquetes y alertas.

CI/CD. Proporciona pruebas y despliegues automáticos que funcionan como mecanismos de validación para agentes.

La clasificación cambia con rapidez porque las herramientas incorporan nuevas capacidades, modelos y modos de autonomía.

Relación con otros conceptos

Programación asistida por inteligencia artificial. Categoría amplia que incluye cualquier apoyo de IA durante la programación.

Codificación agéntica. Se concentra en agentes que escriben, modifican y prueban código.

Desarrollo autónomo de software. Busca niveles superiores de autonomía durante el ciclo de desarrollo.

Vibe coding. Utiliza lenguaje natural y delegación amplia, frecuentemente con menor atención directa al código.

Inteligencia artificial generativa. Produce código, planes, documentación y otros artefactos.

Agentes de inteligencia artificial. Sistemas capaces de razonar, utilizar herramientas y actuar.

Sistemas multiagente. Coordinan varios agentes especializados.

Modelo de lenguaje de gran tamaño. Funciona como núcleo de razonamiento y generación.

Prompt engineering. Diseña instrucciones para orientar una interacción.

Context engineering. Administra la información necesaria para mantener el trabajo del agente.

Harness engineering. Diseña el entorno, herramientas, permisos y ciclos utilizados por el agente.

Model Context Protocol. Conecta agentes con herramientas y datos mediante un estándar.

AGENTS.md. Proporciona instrucciones persistentes dentro de repositorios.

Programación en lenguaje natural. Utiliza descripciones humanas para producir o modificar software.

No-code. Permite construir soluciones mediante configuraciones y componentes visuales.

Low-code. Combina modelos visuales con programación personalizada.

Desarrollo de software. Comprende el ciclo completo de creación y mantenimiento.

Ingeniería de software. Proporciona métodos, procesos y criterios de calidad.

Arquitectura de software. Define componentes, relaciones, restricciones y decisiones fundamentales.

DevOps. Integra desarrollo, pruebas, despliegue y operación.

CI/CD. Automatiza integración, validación y publicación.

Control de versiones. Registra cambios y facilita colaboración.

Revisión de código. Evalúa modificaciones antes de integrarlas.

Pruebas de software. Verifican que el sistema produzca resultados esperados.

Observabilidad. Proporciona información sobre el comportamiento del sistema.

Deuda técnica. Representa costos futuros derivados de decisiones incompletas.

Shadow IT. Incluye aplicaciones creadas fuera de la gobernanza organizacional.

Vendor lock-in. Describe la dependencia frente a una plataforma.

AI slop. Puede utilizarse para describir código abundante y poco útil producido sin control.

Automatización. Ejecuta tareas mediante reglas y sistemas.

Automatización de marketing. Aplica flujos automáticos a procesos comerciales.

Transformación digital. Modifica procesos y modelos mediante tecnología.

Emprendimiento digital. Utiliza software para crear productos y empresas.

Marketing digital. Emplea datos, plataformas y sistemas para relacionarse con mercados.

Diferencias con programación asistida por IA

La programación asistida por IA incluye sugerencias, explicaciones, generación de funciones, pruebas y revisión.

El desarrollo agéntico implica que el sistema utiliza herramientas y ejecuta secuencias de acciones orientadas a un objetivo.

Un asistente puede responder con el código de una función. Un agente puede localizar dónde debe incorporarse, modificar archivos, ejecutar pruebas y preparar un pull request.

La programación asistida puede permanecer dentro de una sola interacción, mientras el desarrollo agéntico suele abarcar múltiples pasos y estados.

Ambos enfoques forman un continuo y pueden coexistir dentro de la misma herramienta.

Diferencias con codificación agéntica

La codificación agéntica se concentra en la implementación, modificación, depuración y prueba del código.

El desarrollo agéntico incluye también requisitos, planificación, arquitectura, documentación, despliegue, operación, coordinación y gobernanza.

Un agente que corrige una función participa en codificación agéntica. Un sistema que convierte una necesidad empresarial en especificación, aplicación, pruebas y despliegue participa en desarrollo agéntico.

La distinción resulta importante porque la producción de código representa únicamente una parte de la ingeniería de software.

Diferencias con vibe coding

El vibe coding suele describir una interacción conversacional donde la persona comunica la apariencia o comportamiento deseado y acepta gran parte del código generado.

El desarrollo agéntico puede utilizar lenguaje natural, aunque incorpora herramientas, planes, pruebas, repositorios, permisos, revisiones y procedimientos organizacionales.

El vibe coding puede ser una práctica personal y exploratoria. El desarrollo agéntico puede utilizarse dentro de equipos profesionales con trazabilidad y gobernanza.

Un proyecto puede comenzar mediante vibe coding y evolucionar hacia un proceso agéntico formal conforme aumenta su criticidad.

Diferencias con desarrollo autónomo

El desarrollo autónomo busca que los agentes ejecuten partes amplias del ciclo con poca intervención humana.

El desarrollo agéntico incluye diferentes grados de autonomía, desde agentes supervisados hasta sistemas parcialmente autónomos.

La autonomía absoluta resulta poco frecuente en sistemas de producción porque las decisiones empresariales, legales, de seguridad y arquitectura requieren responsabilidad humana.

El desarrollo agéntico puede considerarse la categoría general y el desarrollo autónomo una variante ubicada en su extremo de mayor delegación.

Diferencias con no-code y low-code

Las plataformas no-code proporcionan componentes y reglas visuales dentro de límites predeterminados.

Las plataformas low-code permiten agregar código y extensiones.

El desarrollo agéntico utiliza agentes para crear o modificar software mediante acciones sobre herramientas y repositorios.

Un agente puede trabajar dentro de una plataforma no-code, producir extensiones low-code o desarrollar una aplicación tradicional.

La convergencia entre estos enfoques permite que una persona describa una aplicación, observe una interfaz visual y reciba código o configuraciones generadas.

Buenas prácticas

Definir objetivos verificables. La tarea debe expresar resultados y criterios claros.

Clasificar el riesgo. La autonomía debe relacionarse con el impacto potencial.

Preparar el repositorio para agentes. La estructura, documentación y comandos deben ser comprensibles.

Utilizar instrucciones persistentes. Las convenciones deben almacenarse dentro del proyecto.

Solicitar exploración antes de modificar. El agente necesita comprender el sistema.

Exigir un plan para tareas amplias. Las decisiones deben revisarse antes de ejecutar.

Dividir el trabajo. Las etapas pequeñas facilitan pruebas y recuperación.

Limitar permisos. El agente debe acceder únicamente a recursos necesarios.

Utilizar sandboxes. La ejecución debe aislarse de sistemas críticos.

Separar entornos. Desarrollo, pruebas y producción requieren controles diferentes.

Proteger secretos. Las credenciales deben utilizar gestores especializados.

Registrar acciones. Los comandos, cambios y resultados necesitan trazabilidad.

Utilizar control de versiones. Cada tarea debe operar sobre una rama o punto restaurable.

Crear commits frecuentes. Los estados intermedios permiten recuperar progreso.

Revisar diferencias. Una persona debe comprender el alcance de los cambios.

Mantener pruebas confiables. Los agentes necesitan señales objetivas sobre corrección.

Añadir pruebas de regresión. Cada error descubierto debe convertirse en una validación.

Utilizar revisión independiente. Otro agente o una persona debe examinar el resultado.

Analizar dependencias. Los paquetes deben justificarse y mantenerse.

Aplicar análisis de seguridad. Los escáneres complementan las pruebas funcionales.

Controlar costos. Las tareas prolongadas necesitan límites de consumo.

Conservar documentación. El conocimiento no debe quedar únicamente en conversaciones.

Mantener archivos de progreso. Las sesiones sucesivas necesitan continuidad.

Definir condiciones de escalamiento. El agente debe saber cuándo solicitar ayuda.

Evitar modificaciones innecesarias. El cambio debe mantenerse dentro del alcance.

Probar con datos simulados. La información real debe protegerse.

Desplegar gradualmente. Las versiones deben pasar por entornos controlados.

Monitorear producción. Los cambios agénticos requieren observabilidad.

Asignar propietarios. Cada aplicación y agente necesita responsables.

Evaluar de forma continua. Los modelos y herramientas cambian y deben volver a probarse.

Preparar una estrategia de salida. El proyecto debe poder continuar sin un proveedor concreto.

Errores comunes

Asignar objetivos ambiguos. El agente completa vacíos mediante supuestos.

Permitir cambios sin plan. Las tareas extensas pueden desviarse.

Conceder acceso total. Los permisos excesivos aumentan el impacto de fallos.

Operar directamente en producción. Una acción equivocada puede afectar usuarios y datos.

Aceptar todos los cambios. La fluidez del agente no garantiza corrección.

Confiar únicamente en sus pruebas. Implementación y pruebas pueden compartir el mismo supuesto erróneo.

Omitir revisión humana. Los sistemas críticos necesitan responsabilidad profesional.

Utilizar conversaciones como única documentación. El contexto se pierde y dificulta continuidad.

Mezclar demasiadas tareas. El agente puede confundir objetivos y dependencias.

Permitir cambios extensos sin checkpoints. La recuperación se vuelve costosa.

No establecer límites de consumo. Un ciclo improductivo puede generar costos.

Ignorar mensajes de advertencia. Los fallos menores pueden anticipar problemas mayores.

Instalar dependencias sin revisión. Los paquetes pueden ser innecesarios o vulnerables.

Pegar credenciales en prompts. Los secretos pueden quedar expuestos.

Utilizar datos personales en pruebas. La información puede transmitirse a proveedores.

Confundir prototipo con producción. Una demostración necesita seguridad, pruebas y monitoreo.

Medir éxito por cantidad de código. El volumen puede aumentar sin generar valor.

Delegar decisiones empresariales. El agente carece de responsabilidad sobre consecuencias.

Crear agentes sin evaluación. El comportamiento puede cambiar entre modelos y versiones.

Acumular agentes duplicados. La organización puede perder control sobre herramientas y funciones.

Ignorar mantenimiento. El software generado continúa necesitando actualización.

Crear Shadow IT. Las aplicaciones fuera de gobernanza pueden exponer datos.

Permitir sesiones demasiado largas sin resumen. El agente puede perder decisiones importantes.

Utilizar un agente generalista para tareas críticas. La especialización y revisión pueden resultar necesarias.

Confundir actividad con progreso. Numerosas acciones no garantizan cumplimiento del objetivo.

Riesgos de seguridad

El desarrollo agéntico amplía los riesgos de la programación asistida porque los agentes pueden ejecutar acciones sobre sistemas reales.

Ejecución de comandos peligrosos. El agente puede borrar, sobrescribir o modificar recursos.

Exposición de secretos. Las credenciales pueden aparecer en prompts, archivos, logs o respuestas.

Acceso excesivo. Los permisos amplios aumentan el radio de impacto.

Inyección de prompts. Archivos, páginas o incidencias pueden contener instrucciones maliciosas dirigidas al agente.

Envenenamiento de contexto. Información manipulada puede alterar decisiones.

Confusión de autoridad. El agente puede interpretar contenido externo como una instrucción autorizada.

Dependencias maliciosas. El sistema puede instalar paquetes falsos o comprometidos.

Alucinación de paquetes. Un nombre inexistente puede coincidir posteriormente con un paquete malicioso.

Modificación de pipelines. Un agente puede alterar procesos de despliegue o seguridad.

Filtración de datos. Las herramientas pueden enviar información hacia servicios externos.

Configuraciones abiertas. Bases de datos y almacenamiento pueden quedar expuestos.

Autenticación incompleta. El agente puede crear flujos funcionales con protecciones insuficientes.

Autorización defectuosa. Los usuarios pueden acceder a recursos ajenos.

Código inseguro. La generación puede introducir vulnerabilidades conocidas.

Persistencia maliciosa. Una modificación puede crear accesos ocultos o tareas recurrentes.

Manipulación de pruebas. El agente puede cambiar pruebas para que el código parezca correcto.

Evasión de controles. El sistema puede buscar rutas alternativas cuando encuentra una restricción.

Acciones irreversibles. Algunas operaciones sobre datos no pueden restaurarse fácilmente.

Ataques a la cadena de herramientas. Los servidores MCP, plugins y API pueden comprometer el entorno.

Las mitigaciones incluyen:

  • privilegio mínimo;
  • aislamiento;
  • autorización por acción;
  • listas de herramientas permitidas;
  • protección de ramas;
  • revisión de dependencias;
  • análisis de seguridad;
  • gestión de secretos;
  • copias de respaldo;
  • registros;
  • filtros de contenido;
  • límites de red;
  • validación humana;
  • respuesta a incidentes.

Privacidad y propiedad intelectual

Los agentes pueden procesar repositorios privados, documentación, datos comerciales, diseños, incidencias y credenciales.

Las organizaciones deben revisar:

  • política de retención;
  • uso para entrenamiento;
  • residencia de datos;
  • cifrado;
  • controles administrativos;
  • registros;
  • identidad del proveedor;
  • subprocesadores;
  • mecanismos de eliminación;
  • cumplimiento normativo;
  • opciones locales;
  • aislamiento entre clientes.

La propiedad intelectual incluye preguntas relacionadas con:

  • autoría del código;
  • licencias de dependencias;
  • similitud con proyectos existentes;
  • obligaciones de atribución;
  • derechos sobre prompts;
  • derechos sobre resultados;
  • contribuciones de agentes;
  • políticas de repositorios;
  • patentes;
  • secretos comerciales.

Los cambios generados deben someterse a los mismos controles legales y de licencia que el código humano.

Desafíos éticos y organizacionales

Responsabilidad. La organización conserva responsabilidad sobre el software que publica.

Transparencia. Los equipos pueden necesitar registrar cuándo intervino un agente.

Autoría. La contribución surge de personas, modelos, herramientas y fuentes.

Supervisión. Deben definirse responsables de revisar y aprobar.

Privacidad laboral. Las herramientas pueden registrar actividad, prompts y decisiones de empleados.

Evaluación de desempeño. Las métricas de uso de agentes pueden utilizarse de forma simplista.

Desplazamiento de tareas. Algunas funciones se automatizan y otras adquieren mayor importancia.

Redistribución de habilidades. La especificación, arquitectura, revisión y gobernanza ganan relevancia.

Dependencia cognitiva. El uso constante puede reducir la práctica de diagnóstico manual.

Acceso desigual. Los mejores agentes y modelos pueden depender de planes costosos.

Concentración tecnológica. Pocos proveedores pueden controlar infraestructura y modelos.

Sesgos técnicos. Los agentes pueden favorecer tecnologías o patrones frecuentes.

Calidad profesional. La facilidad de construcción puede permitir sistemas sensibles sin experiencia suficiente.

Proliferación de software. Las empresas pueden acumular aplicaciones redundantes.

Carga de revisión. Los mantenedores pueden recibir más cambios de los que pueden evaluar.

Impacto sobre código abierto. Los agentes pueden aumentar contribuciones de baja calidad.

Sostenibilidad. Las tareas prolongadas consumen recursos computacionales.

Gobernanza distribuida. Los equipos necesitan autonomía acompañada de estándares.

Decisiones automatizadas. Los agentes no deben asumir autoridad sobre consecuencias legales o humanas.

Confianza. La adopción depende de que los sistemas produzcan resultados comprensibles y verificables.

Gobernanza organizacional

Una organización puede construir un marco de gobernanza compuesto por:

  • catálogo de agentes autorizados;
  • evaluación de proveedores;
  • clasificación de datos;
  • clasificación de repositorios;
  • niveles de autonomía;
  • niveles de riesgo;
  • control de identidades;
  • permisos mínimos;
  • sandboxes;
  • protección de secretos;
  • políticas de red;
  • instrucciones organizacionales;
  • AGENTS.md;
  • repositorios obligatorios;
  • revisión humana;
  • pruebas;
  • análisis de seguridad;
  • aprobación de dependencias;
  • registro de acciones;
  • control de costos;
  • inventario de aplicaciones;
  • responsables;
  • evaluaciones;
  • auditoría;
  • respuesta a incidentes;
  • planes de continuidad;
  • procedimientos de retiro.

Una clasificación práctica puede dividir las tareas en cuatro niveles.

Nivel bajo. Documentación, análisis, prototipos y scripts sin datos sensibles.

Nivel moderado. Herramientas internas con acceso limitado y recuperación sencilla.

Nivel alto. Aplicaciones públicas, sistemas comerciales y datos de clientes.

Nivel crítico. Salud, finanzas, infraestructura, seguridad, industria y decisiones legales.

Los niveles superiores requieren menor autonomía, mayor aislamiento, revisiones especializadas y autorizaciones explícitas.

Impacto actual

El desarrollo agéntico está modificando la unidad de trabajo dentro de la ingeniería de software. El usuario puede delegar una tarea completa y recibir una propuesta de cambio en lugar de solicitar únicamente un fragmento.

GitHub permite asignar incidencias a agentes que trabajan sobre ramas y preparan pull requests. OpenAI Codex ejecuta tareas paralelas dentro de sandboxes. Jules integra acciones de desarrollo con repositorios y API. Claude Code funciona desde terminales, editores y entornos administrados.

Las organizaciones experimentan con agentes para escribir pruebas, corregir incidencias, actualizar dependencias, modernizar sistemas y construir herramientas internas.

La adopción también está creando una diferencia entre producir código y producir software confiable. Los agentes pueden generar cambios con rapidez, aunque la integración depende de pruebas, revisión, arquitectura, contexto y confianza.

La investigación sobre agentes utilizados en repositorios reales muestra que sus cambios pueden enviarse con mayor velocidad y presentar menor complejidad promedio, aunque reciben tasas de aceptación inferiores a las contribuciones humanas en diferentes muestras.

Los desarrolladores profesionales utilizan estrategias de control como planes, permisos, tareas pequeñas, revisión de diferencias y pruebas. Esta conducta muestra que la experiencia continúa siendo relevante cuando se delega ejecución.

El papel humano comienza a concentrarse en:

  • definir objetivos;
  • elegir prioridades;
  • diseñar arquitectura;
  • proporcionar contexto;
  • establecer restricciones;
  • evaluar planes;
  • revisar cambios;
  • resolver ambigüedades;
  • administrar riesgos;
  • coordinar agentes;
  • asumir responsabilidad.

El cuello de botella se desplaza parcialmente desde escribir código hacia formular problemas, preparar entornos, verificar resultados y mantener coherencia.

En marketing y pequeñas empresas, el desarrollo agéntico reduce el costo inicial de construir soluciones específicas. La ventaja competitiva depende de identificar problemas valiosos y convertir prototipos rápidos en sistemas mantenibles.

Futuro y tendencias

Agentes de mayor duración. Los sistemas trabajarán durante horas o días sobre proyectos complejos.

Memoria persistente. Los agentes conservarán decisiones, preferencias, errores y contexto entre tareas.

Equipos multiagente. Diferentes agentes colaborarán sobre roles especializados.

Centros de comando. Las personas supervisarán varios agentes, repositorios y tareas desde una interfaz.

Desarrollo basado en especificaciones. Los documentos persistentes orientarán la implementación.

Harnesses especializados. Cada organización diseñará entornos adaptados a sus procesos.

Evaluaciones continuas. Los agentes se probarán antes y después de cada actualización.

Contexto organizacional. Los sistemas accederán a documentación, diseños, datos y políticas autorizadas.

Habilidades reutilizables. Los procedimientos se empaquetarán para agentes y equipos.

Agentes personalizados. Cada repositorio tendrá colaboradores configurados según sus tecnologías y normas.

Revisión entre agentes. Un agente evaluará el trabajo de otro.

Pruebas adversariales automáticas. Los sistemas intentarán encontrar fallos en sus propias soluciones.

Seguridad integrada. Los agentes recibirán controles de permisos, análisis y contención desde el inicio.

Observabilidad agéntica. Las organizaciones medirán acciones, decisiones, costos y errores.

Despliegue supervisado por agentes. Los sistemas administrarán liberaciones graduales y reversiones.

Mantenimiento continuo. Los agentes detectarán actualizaciones, incidencias y deuda técnica.

Modernización a gran escala. Las organizaciones utilizarán agentes para transformar sistemas heredados.

Desarrollo multimodal. Los agentes utilizarán diseños, voz, video, diagramas y documentos.

Programación desde dispositivos móviles. Las personas asignarán y revisarán tareas desde teléfonos.

Mercados de agentes. Las empresas adquirirán agentes especializados, herramientas y evaluaciones.

Estándares abiertos. Convenciones como AGENTS.md y protocolos de herramientas favorecerán interoperabilidad.

Portabilidad de memoria. Los proyectos buscarán trasladar instrucciones y contexto entre proveedores.

Modelos locales. Las organizaciones sensibles ejecutarán agentes dentro de infraestructura propia.

Sistemas híbridos. Los equipos combinarán modelos locales y servicios administrados.

Agentes empresariales conectados. Los sistemas de desarrollo interactuarán con producto, soporte, marketing y operaciones.

Software autoadaptable. Algunas aplicaciones podrán detectar problemas y proponer cambios.

Gobernanza automatizada. Los sistemas clasificarán tareas y aplicarán controles según riesgo.

Nuevos perfiles profesionales. Crecerán funciones como arquitecto de agentes, ingeniero de harness, evaluador y responsable de gobernanza.

Revalorización del criterio. La abundancia de implementación elevará la importancia de seleccionar problemas y evaluar consecuencias.

Transformación de la educación. La formación técnica incorporará supervisión de agentes, arquitectura, pruebas, seguridad y contexto.

Desarrollo parcialmente autónomo. Las tareas rutinarias podrán operar mediante supervisión por excepciones.

Ingeniería de software para agentes. Los repositorios, herramientas y procesos se diseñarán para que personas y agentes puedan utilizarlos.

Véase también

Referencias

Bibliografía

  • Anthropic. Building Effective AI Agents. 2024.
  • Anthropic. Effective Context Engineering for AI Agents. 2025.
  • Anthropic. Effective Harnesses for Long-Running Agents. 2025.
  • Bhati, Happy. Agentic AI in the Software Development Lifecycle: Architecture, Empirical Evidence, and the Reshaping of Software Engineering. arXiv, 2026.
  • Bouzenia, Islem; Pradel, Michael. Understanding Software Engineering Agents: A Study of Thought-Action-Result Trajectories. arXiv, 2025.
  • GitHub. GitHub Copilot Cloud Agent Documentation.
  • Google. Jules API Documentation.
  • Hassan, Ahmed E.; Li, Hao; Lin, Dayi; Adams, Bram; Chen, Tse-Hsun; Kashiwa, Yutaro; Qiu, Dong. Agentic Software Engineering: Foundational Pillars and a Research Roadmap. arXiv, 2025.
  • Huang, Ruanqianqian; Reyna, Avery; Lerner, Sorin; Xia, Haijun; Hempel, Brian. Professional Software Developers Don’t Vibe, They Control: AI Agent Use for Coding in 2025. arXiv, 2025.
  • Jimenez, Carlos E. et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues?. arXiv, 2023.
  • Li, Hao; Zhang, Haoxiang; Hassan, Ahmed E. The Rise of AI Teammates in Software Engineering (SE 3.0). arXiv, 2025.
  • OpenAI. Introducing Codex. 2025.
  • OpenAI. Unrolling the Codex Agent Loop. 2026.
  • OpenAI. Harness Engineering: Leveraging Codex in an Agent-First World. 2026.
  • Roychoudhury, Abhik. Agentic AI for Software: Thoughts from a Software Engineering Perspective. arXiv, 2025.