Configure
Guardrails
Reglas de herramientas, inyección de prompts y políticas.
Los guardrails son políticas por agente. Están apagados si no configuras nada, y
se activan en Agents → <agente> → Guardrails.
Son tres mecanismos distintos, no tres ajustes de lo mismo, y leerlos como si fueran uniformes es lo que lleva a pagar una llamada al modelo por algo que ya resolvió una comparación de texto:
| Eje | Costo | Puede fallar |
|---|---|---|
| Reglas de herramientas | ninguno | no, es determinista |
| Inyección de prompts | ninguno | no, es determinista |
| Políticas (juez LLM) | una llamada al modelo por respuesta | sí, y falla abierto |

Reglas de herramientas
El eje más importante aquí, y el que no tiene equivalente en otras plataformas.
El problema que resuelve es concreto: las herramientas del entorno son automáticas, así que un agente con la búsqueda web desmarcada igual llega a internet ejecutando un comando en su contenedor. Una regla de salida no puede atrapar eso — «la página responde, HTTP 200» es una frase corta e inocua.
Una regla deniega por patrón de texto:
guardrails:
tool_rules:
- deny_pattern: "curl "
reason: "Este agente no consulta internet directamente."
Dos cosas que importan:
El espacio en blanco es significativo y no se recorta. "curl " con el
espacio final existe para no coincidir también con curly. Recortarlo
ensancharía en silencio una regla escrita estrecha.
Denegar no es esconder. La herramienta sigue en el esquema del modelo y la
negativa vuelve como resultado de la llamada. Si se escondiera, el modelo
buscaría un sustituto — que es exactamente lo que hace. Con la regla puesta, un
agente intentó curl una vez, leyó el motivo y contestó que no podía verificar
eso, en vez de buscar otra vía.
Inyección de prompts
Detecta frases idiomáticas del ataque en los resultados de herramientas y las redacta antes de que lleguen al modelo.
Los marcadores son idiomáticos, no meramente sospechosos. Frases como «ahora eres» o «you are now» se quitaron de la lista: «ahora eres responsable del activo» es normal en un registro de inventario, y un falso positivo borra datos del propio cliente del contexto del modelo.
La redacción corta por delimitadores estructurales —saltos de línea, comillas, llaves— y no por frase. Es contraintuitivo y es lo correcto: la frase gatillo es la señal, y lo que va después es la carga. Cortando por estructura, se va el campo comprometido y el registro sigue siendo usable.
El evento guardado conserva el texto original; solo se reescribe lo que lee el modelo.
Políticas
Un juez LLM revisa la respuesta antes de entregarla. Es el único eje que cuesta dinero y el único que puede fallar.
guardrails:
policies:
judge_model: claude-haiku-4-5-20251001
rules:
- "No prometer plazos de entrega."
Cuatro consecuencias que conviene saber:
- Falla abierto y lo dice. Si el juez no responde, la respuesta pasa. Un guardrail que bloquea cuando se cae sería peor que no tenerlo.
- Una respuesta bloqueada nunca se guarda. El modelo no recuerda haberla dicho, así que no puede abrir el siguiente turno con «como te decía».
- Con el juez activo se suspende el streaming. Reemplazar un texto que el visitante ya leyó tres segundos es cosmético, no un control.
- Solo se juzga la respuesta final, la que no llama herramientas. El texto intermedio es narración del proceso, que el widget ya pliega.
El juez no tiene que ser de la misma familia que el agente: es una llamada sin estado, así que un juez barato sobre un agente caro es justo la configuración que quieres. Sí tiene que estar registrado.
Aviso
Los tokens del juez se registran aparte y no se suman al costo de la
sesión. Se ven en la pestaña Debug, pero el total de la sesión no los
incluye todavía.
Categorías de contenido
No existen a propósito. Los conjuntos tipo «manipulación / contenido / foco» están calibrados para agentes de voz hablando con consumidores; la superficie aquí es un agente B2B detrás de una clave publicable, donde el fallo realista es que el agente haga algo indebido con los datos de un cliente. Cuando hagan falta, conviene comprarlas antes que reimplementarlas.
