Calculadora de risco de modelos abliterados
Pontue o risco de um LLM sem recusas («abliterado») antes que ele entre no seu ambiente.
Abrir a ferramenta →A ferramenta interativa abre em inglês.
A Calculadora de risco de modelos abliterados pontua o risco de implantar um LLM sem recusas («abliterado» ou «sem censura») em um contexto específico. A abliteração edita os pesos do modelo para remover a direção interna que produz as recusas, de modo que o modelo responde a tudo, inclusive pedidos ofensivos. O modelo sozinho não é o risco; o alcance e a governança são.
- Escolha o tipo de modelo: com segurança, base aberto, fine-tune, abliterado, ou abliterado com fine-tune ofensivo.
- Descreva a procedência, o código personalizado, o escopo, os dados, os usuários e a governança.
- Leia a pontuação por faixa e trabalhe os controles recomendados; nada sai do seu navegador.
Perguntas frequentes
O que é um modelo abliterado?
Um LLM de pesos abertos ao qual se removeu, editando os pesos, a capacidade de recusar pedidos. Não adiciona conhecimento; tira o freio.
É legal usá-lo?
Possuir ou executar o modelo geralmente não é ilegal; o que você faz com ele é regido pela lei, sua licença e sua política de uso aceitável. Equipes de red team autorizadas têm um uso legítimo.
Qual é o maior fator de risco?
Conectar um modelo sem recusas a um agente com ferramentas e credenciais, sem aprovação nem registro.