Material gratuito

O desvio de segurança do Fable 5 — quando você não tá falando com ele

Em certos temas a Anthropic troca o Fable por outro modelo sem te avisar — quando acontece e como conferir qual respondeu.

O desvio de segurança do Fable 5 — quando você não tá falando com ele

Quando a Anthropic lançou o Fable 5 (09/06/2026), ela documentou um detalhe que quase ninguém leu: em alguns temas, o modelo que responde você não é o Fable.

Não é bug nem teoria — é um classificador de segurança que roda junto com o modelo. Quando você toca num assunto sensível, a sua pergunta é desviada na hora pra um modelo mais contido (o Opus 4.8), sem nenhum aviso na tela.

Quando o desvio acontece

O desvio dispara em quatro tipos de tema, segundo a própria Anthropic:

  • Ciber-segurança (ataques, invasão, malware)
  • Biologia perigosa (armas/agentes biológicos)
  • Química perigosa (síntese de substâncias nocivas)
  • Cópia do modelo (tentar extrair/destilar a tecnologia dele)

Fora desses temas, é o Fable respondendo.

O número que importa pra quem usa IA pra trabalhar

A Anthropic afirma que mais de 95% das sessões nunca acionam esse desvio. No uso normal de negócio — escrever, planejar, analisar, criar conteúdo, programar coisas do dia a dia — você está falando com o Fable de verdade quase o tempo todo.

Ou seja: o desvio existe pra conter risco real, não pra te limitar no trabalho.

Como conferir qual modelo respondeu de verdade

Se você usa a API (ou Claude Code): toda resposta traz o campo model. Confira ele:

  • Resposta pelo Fable → model: "claude-fable-5"
  • Caiu no desvio → model: "claude-opus-4-8"

E quando é uma recusa por segurança, a resposta traz stop_reason: "refusal" com a categoria em stop_details.category (cyber ou bio, por exemplo). É o jeito de saber, preto no branco, quem te respondeu.

Se você usa só o app/chat: não tem um selo na tela, mas a regra prática vale — se você não está num daqueles quatro temas, é o Fable. Na dúvida num assunto sensível, refaça a pergunta de forma mais neutra e genérica.

Resumo (pra não esquecer)

  1. O Fable tem um detector de segurança rodando por baixo.
  2. Em ciber, bio, química e cópia de modelo, a pergunta vai pro Opus 4.8 — sem aviso.
  3. +95% das conversas não acionam isso. No trabalho, você usa o Fable de verdade.
  4. Pela API dá pra confirmar no campo model da resposta.

Informação confirmada no material de lançamento do Claude Fable 5 (Anthropic, junho/2026) e na documentação da API.

Curtiu? Tem mais coisa esperando.

Ver todos os materiais