Herramienta gratuita · sin registro

Calculadora de riesgo de modelos abliterados

Puntúa el riesgo de un LLM sin rechazos («abliterado») antes de que entre en tu entorno.

Abrir la herramienta →

La herramienta interactiva se abre en inglés.

La Calculadora de riesgo de modelos abliterados puntúa el riesgo de desplegar un LLM sin rechazos («abliterado» o «sin censura») en un contexto concreto. La abliteración edita los pesos del modelo para eliminar la dirección interna que produce los rechazos, de modo que el modelo responde a todo, incluidas peticiones ofensivas. El modelo por sí solo no es el riesgo; el alcance y la gobernanza lo son.

  1. Elige el tipo de modelo: con seguridad, base abierto, fine-tune, abliterado, o abliterado con fine-tune ofensivo.
  2. Describe la procedencia, el código personalizado, el alcance, los datos, los usuarios y la gobernanza.
  3. Lee la puntuación por banda y trabaja los controles recomendados; nada sale de tu navegador.

Preguntas frecuentes

¿Qué es un modelo abliterado?

Un LLM de pesos abiertos al que se le ha eliminado, editando sus pesos, la capacidad de rechazar peticiones. No añade conocimiento; quita el freno.

¿Es legal usarlo?

Poseer o ejecutar el modelo no suele ser ilegal; lo que hagas con él se rige por la ley, su licencia y tu política de uso aceptable. Equipos de red team autorizados tienen un uso legítimo.

¿Cuál es el mayor factor de riesgo?

Conectar un modelo sin rechazos a un agente con herramientas y credenciales, sin aprobación ni registro.

Calculadora de riesgo de modelos abliterados · PlayCISO · PlayCISO