Barreras de seguridadGuardrails
La cerca de seguridad que se instala para que la IA no la cruce
- Las barreras de seguridad son una cerca instalada de antemano para que la IA no la cruce. Son un dispositivo aparte, distinto de la tendencia que el modelo aprendió por dentro.
- Se ubican en tres lugares principales: la solicitud que entra, la respuesta que sale, y las herramientas y permisos que tiene la IA.
- No basta con que el modelo se niegue por su cuenta. Esa negativa es una tendencia que se tambalea, así que hace falta una capa más por fuera.
- Si se instalan demasiado estrechas, bloquean también el uso normal. Decidir cuánto bloquear es el corazón del diseño de estas barreras.
- Comprobar antes del lanzamiento si la cerca de verdad aguanta, tratando de cruzarla a propósito, es lo que se llama red teaming.
Contenido
1La analogía
En el parque de juegos hay cosas que se instalan antes de que lleguen los niños: una cerca baja alrededor del perímetro, una colchoneta gruesa bajo los juegos, y un pasamanos junto al tobogán.
Ninguna de estas cosas impide jugar. La cerca solo evita que la pelota ruede hasta la calle; la colchoneta reduce el golpe si alguien se cae; el pasamanos solo ayuda a quien lo necesita, sin frenar a nadie más. En un día en que no pasa nada, ni siquiera se nota que están ahí.
Lo importante es que se instalaron antes de que ocurriera un accidente, no después. En los servicios de IA existen dispositivos parecidos, instalados de antemano, y a eso se le llama barreras de seguridad.
2En detalle
Se instalan por fuera del modelo, no por dentro
Para que la IA rechace una solicitud peligrosa, actúan dos cosas a la vez. Una es la tendencia que aprendió durante el entrenamiento. Esto está dentro del modelo y no se puede abrir ni apagar a voluntad. La otra es el dispositivo que el servicio instala por fuera, y este sí se puede ver como una regla, activar, desactivar o modificar.
Las barreras de seguridad se refieren a esto último. Como están por fuera, se mantienen aunque se cambie el modelo, y cuando algo falla se puede señalar con claridad qué parte corregir. Es como la cerca y la colchoneta, que están siempre en el mismo lugar sin importar quién venga a jugar.
La tendencia interna y el dispositivo externo no se reemplazan entre sí: la tendencia se tambalea según el contexto, y el dispositivo no siempre capta el matiz fino de las palabras. Por eso se colocan uno encima del otro.
Una revisión a la entrada, otra a la salida
La revisión de la solicitud que entra mira si esa solicitud cae dentro de un área que el servicio decidió no atender. Si algo se detiene aquí, ni siquiera llega al modelo y sale un mensaje explicativo. Es rápida y barata, pero si el riesgo no se nota en la redacción, se le puede escapar.
La revisión de la respuesta que sale mira si hay algún problema en lo que ya se generó: la solicitud era normal pero la respuesta se desvió, o el material consultado resultó problemático. A cambio, toma más tiempo, porque la respuesta ya está completa, y aparece la incomodidad de retirar a mitad de camino algo que ya se estaba mostrando.
Las dos revisiones fallan en lugares distintos. Una mira la intención; la otra, el resultado. Por eso es poco común que un servicio tenga solo una de las dos.
Reducir lo que la IA puede hacer es la cerca más firme
Una revisión basada en palabras siempre tiene alguna rendija. Si se cambia la forma de decir algo, puede pasar sin ser detectado, y si se hace demasiado estricta, empieza a bloquear también expresiones normales. En cambio, lo que la IA sencillamente no puede hacer no se puede lograr con ninguna redacción.
Por eso, en la práctica, la barrera más sólida suele estar del lado de los permisos: darle a la IA solo las herramientas que necesita, no otorgar permiso de escritura donde solo hace falta leer, y colocar una confirmación humana antes de cualquier acción irreversible. Por bien redactada que esté una frase, no puede mover una mano que no existe.
En la misma categoría entra el poner una cinta alrededor de un juego roto. Si se instala de antemano un interruptor que apague de inmediato una función en cuanto aparece una señal rara, el daño se detiene mientras se repara.
Si se instala demasiado estrecha, se deja de poder jugar
Cerrar demasiado la cerca tiene un costo. Preguntas sobre seguridad, explicaciones generales sobre medicina o derecho, obras creativas donde aparece violencia: solicitudes normales quedan atrapadas junto con las que sí eran un problema. A esto se le llama rechazo excesivo, y parece seguro por fuera, pero trae dos problemas: el servicio pierde utilidad, y la gente termina yéndose a otros canales sin ninguna revisión.
Por eso, al evaluar estas barreras siempre se miran dos números juntos: cuánto se bloqueó de lo que debía bloquearse, y cuánto de lo que no debía. Si solo se mira uno de los dos, el otro termina cayéndose sin remedio.
Comprobar que la cerca sigue en pie
Instalar una cerca y que esa cerca realmente aguante son dos cosas distintas. Puede pasar que una regla escrita en la documentación falte en el código, o que al agregar una función nueva se salte por descuido una revisión. Por eso se reserva un proceso aparte, hecho por personas distintas de quienes construyeron el sistema, para intentar cruzarla a propósito.
Esa comprobación es el red teaming. Si las barreras son el lado que se instala de antemano, el red teaming es el lado que intenta cruzarlas, y las dos tareas funcionan en pareja: cuando ese ejercicio encuentra un punto débil, ese caso se vuelve el material con el que se construye la siguiente cerca.
3Con más precisión
La palabra barreras de seguridad se usa con un alcance algo distinto según quién la use. A veces incluye también el ajuste de seguridad que se hace entrenando el modelo; otras veces se refiere solo al dispositivo de revisión externo. Este artículo usó el segundo sentido: la tendencia interna la maneja el ajuste de seguridad del entrenamiento, y el dispositivo externo lo manejan las barreras.
También hay varias formas de construir ese dispositivo: una lista de expresiones prohibidas, un modelo pequeño que juzga si una solicitud es riesgosa, o un modelo grande al que se le entrega un documento de políticas para que juzgue por sí mismo. La lista es rápida pero se le escapa cualquier variación en la redacción; el modelo de juicio es más flexible pero cuesta más tiempo y recursos.
La analogía también tiene sus límites. El riesgo del parque se ve a simple vista y se mide en altura y distancia; el riesgo en palabras cambia de límite según la situación. La colchoneta funciona igual sin importar quién se caiga, pero una revisión de lenguaje rinde muy distinto según el idioma. Y el parque puede retirar directamente un juego peligroso, mientras que en la IA primero hay que decidir qué cuenta como función peligrosa.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que, con estas barreras, ya queda todo seguro, pero en realidad solo reducen la probabilidad, así que el resto del sistema hay que diseñarlo asumiendo que algo se va a escapar.
Es fácil pensar que las barreras de seguridad son una lista de palabras prohibidas, pero en realidad reducir las herramientas y los permisos que tiene la IA funciona de forma mucho más sólida.
Es fácil pensar que mientras más estrecha, mejor, pero en realidad, si se bloquean también las solicitudes normales, la gente se va a canales sin ninguna cerca, y el riesgo termina creciendo.
7Resumen en una línea
En resumenLas barreras de seguridad son varias capas de dispositivos instaladas por fuera del modelo antes de que ocurra un accidente, y decidir cuán estrechas hacerlas también es parte del diseño.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02