Lo que aprenderás en esta guía
Este es un artículo técnico y profundo redactado por los ingenieros de ForgeNEX. Está diseñado para profesionales que buscan implementar soluciones sólidas y evitar los errores comunes que cuestan horas de producción.
Trata las entradas externas como datos no confiables
Un agente que lee correos, páginas web, documentos o tickets puede recibir instrucciones maliciosas dentro de contenido que debía analizar. La prompt injection intenta que el modelo ignore su tarea, revele información o invoque herramientas de forma inadecuada. No hay una frase de sistema que garantice por sí sola que esto no ocurra.
Diseña el sistema para que una salida manipulada tenga el menor impacto posible. La seguridad depende de permisos, separación de funciones, validación del lado servidor y límites de ejecución; no de pedir al modelo que “tenga cuidado”.
Controles prioritarios
- Mínimo privilegio: ofrece solo herramientas necesarias; separa lectura y escritura, limita recursos y aplica permisos por usuario o tarea.
- Validación fuera del modelo: comprueba identidad, campos, reglas de negocio, destinatario y límites antes de ejecutar una acción.
- Aprobación para impacto: exige confirmación humana para operaciones sensibles, externas o difíciles de revertir.
- Separación de datos e instrucciones: marca contenido recuperado como no confiable; no lo conviertas en instrucciones ejecutables ni en configuración del sistema.
- Aislamiento: ejecuta código o conectores con límites de red, tiempo y recursos; evita que una herramienta acceda a secretos ajenos al caso.
- Protección de secretos: usa un gestor de credenciales, evita incluir claves en prompts y restringe qué datos pueden aparecer en logs.
- Trazabilidad y parada: registra invocaciones, usuario, herramienta, decisión y resultado; habilita revocación de credenciales y suspensión rápida.
Un patrón de integración más seguro
En lugar de permitir que el modelo construya una consulta SQL arbitraria o envíe una solicitud HTTP libre, define herramientas estrechas como consultar_estado_pedido(id) o preparar_borrador_respuesta(ticket_id). Valida sus parámetros con esquemas, aplica autorización en el servicio y devuelve solo los datos necesarios. Para escrituras, separa “preparar” de “confirmar” y vincula la aprobación a una versión concreta del cambio.
Los documentos recuperados pueden contener instrucciones hostiles. Mantén las instrucciones del agente fuera del contenido del usuario, limita qué datos se incorporan al contexto y evita que una respuesta del modelo autorice por sí sola una herramienta. Prueba filtraciones indirectas desde fuentes conectadas, no solo prompts escritos directamente por un usuario.
Pruebas antes de producción
Incluye casos de prompt injection directa e indirecta, escalada de permisos, acceso a otro usuario, datos sensibles en la respuesta, argumentos inválidos, repetición de transacciones y caída de dependencias. Comprueba que el resultado seguro sea detenerse, pedir aclaración o escalar, no improvisar.
Repite estas pruebas cuando cambien modelo, prompt, corpus, permisos o herramientas. La guía de evaluación de agentes propone criterios de aceptación; el gobierno de agentes asigna responsables y revisiones.
Referencias: OWASP — Excessive Agency y OWASP GenAI Security Project — Agentic Threats Navigator.
¿Demasiado complejo para tu equipo?
En ForgeNEX gestionamos este tipo de soluciones tecnológicas todos los días. Evita riesgos y delega la implementación en nuestros expertos.
- Respuesta en menos de 2 horas
- Auditamos tu caso sin compromiso
- Expertos certificados