Anthropic corta internet de testes após agentes burlarem sistemas
Anthropic suspende acesso à internet em testes internos após agentes de IA explorarem falhas de software e enviarem denúncia falsa à polícia.
Nish Tahir demonstra como transformar o Qwen3-1.7B em um modelo de decisão ágil usando decodificação restrita e calibração por escalonamento de temperatura.
O desenvolvedor Nish Tahir apresentou uma metodologia prática para a construção dos chamados modelos de decisão do "Sistema 1" ("System one" decision models), focada em obter respostas rápidas e probabilidades calibradas sem a sobrecarga computacional da geração autoregressiva convencional. Em vez de depender de arquiteturas de saída estruturada convencionais — que exigem múltiplos passos de inferência token a token para gerar formatos como JSON —, a técnica restringe o vocabulário a opções pré-definidas em uma única passagem computacional, demonstrando o fluxo com o modelo aberto Qwen/Qwen3-1.7B.
Em modelos de linguagem convencionais, a produção de saídas tipadas via técnicas de Structured Output impõe restrições para garantir uma formatação válida, mas mantém o custo da geração token por token. Como explica Nish Tahir, embora a fase de pré-preenchimento (prefill) processe o contexto inicial de uma só vez, cada novo token emitido demanda um passe completo pela rede neural. Em um cenário prático exemplificado pelo autor, a geração de uma resposta estruturada exigiu 11 passes de inferência consecutivos, mesmo sem considerar estratégias de aceleração como speculative decoding ou outras técnicas de otimização de decodificação.
A abordagem dos modelos de decisão, exemplificada pelo projeto Jev, parte do pressuposto de que o sistema precisa apenas selecionar alternativas pré-determinadas (como as opções A, B, C, D e E) em vez de redigir frases completas. Ao aplicar uma máscara rígida sobre todo o vocabulário remanescente do modelo, o sistema de inferência avalia exclusivamente os logits vinculados às letras permitidas. Essa restrição mecânica possibilita que a escolha final ocorra em um único passe, elegendo o token que obtiver o valor de probabilidade mais elevado na saída da camada softmax.
A decodificação restrita (constrained decoding) altera drasticamente o comportamento padrão dos modelos causais ao limitar matematicamente o espaço de busca da camada final de predição. De acordo com Nish Tahir, ao restringir o vocabulário aos tokens correspondentes às alternativas A, B, C, D e E, a rede torna-se matematicamente incapaz de emitir qualquer resposta alheia a essas opções. No entanto, o autor ressalta um alerta crítico para a engenharia de software: impedir saídas inválidas não assegura que a alternativa selecionada seja conceitualmente correta.
Outro erro conceitual comum apontado no artigo reside em tratar as probabilidades puras de saída dos tokens como índices diretos de precisão factual. Nish Tahir destaca que, na ausência de procedimentos específicos de treinamento e ajuste estatístico, essas pontuações refletem unicamente a confiança do modelo sobre qual será o próximo caractere a ser gerado no fluxo textual, e não a probabilidade real de que a resposta escolhida corresponda à verdade do mundo real ou ao gabarito do problema formulado.
Essa discrepância probabilística evidencia a barreira entre fluência sintática e acurácia decisória em sistemas orientados a tarefas automáticas. Para ilustrar a mecânica dessa camada de decisão de passe único, Nish Tahir estruturou um pipeline em Python utilizando os pacotes da biblioteca Hugging Face transformers e do ecossistema PyTorch, montando um teste reprodutível em torno dos pesos do modelo Qwen/Qwen3-1.7B.
O fluxo de implementação publicado por Nish Tahir utiliza as classes AutoModelForCausalLM e AutoTokenizer para carregar o modelo de linguagem Qwen/Qwen3-1.7B com mapeamento automático de dispositivos (device_map="auto") e precisão de ponto flutuante dinâmica (torch_dtype="auto"). A base do script define explicitamente a lista de alternativas válidas na variável options = ["A", "B", "C", "D", "E"] e mapeia os identificadores numéricos desses caracteres por meio do tokenizador através de tokenizer.encode(opt, add_special_tokens=False)[0], isolando a lista option_token_ids.
A preparação do prompt de entrada é estruturada por meio de uma função que combina a pergunta fornecida com as cinco alternativas formatadas linha a linha, finalizando a instrução com o prefixo "Answer:". Na sequência, a chamada ao método tokenizer.apply_chat_template organiza os dados como uma mensagem do perfil user, ativando os parâmetros add_generation_prompt=True e desativando explicitamente qualquer etapa de reflexão profunda com enable_thinking=False, garantindo que o primeiro token emitido pelo assistente seja diretamente a resposta avaliada.
Durante a execução com torch.no_grad(), o script não realiza loops de geração autoregressiva. Em vez disso, extrai apenas a última linha de valores de saída dos tensores da rede com a instrução logits = model(**model_inputs).logits[0, -1]. A partir desse vetor de ativação bruta, aplica-se a função exponencial normalizada exclusivamente sobre os índices das opções permitidas via probs = torch.softmax(logits[option_token_ids].float(), dim=-1), determinando a predição através do método argmax().
Para validar a integridade estrutural do pipeline em um caso evidente, Nish Tahir submeteu o arquivo question.json contendo a pergunta "What color is the sky?" (Qual a cor do céu?), com as alternativas A: "Red", B: "Blue", C: "Green", D: "Purple" e E: "I don't know". O sistema retornou instantaneamente a predição B, distribuindo as probabilidades com 0.9988 para a opção Blue, 0.0012 para I don't know, e marcas de 0.0000 para Red, Green e Purple, demonstrando aderência imediata no cenário trivial.
Após comprovar o funcionamento no teste unitário básico, o autor submeteu a implementação a um desafio em escala real utilizando um conjunto aleatório de validação retido (holdout) extraído do benchmark CommonsenseQA, totalizando 1.221 questões de raciocínio de senso comum. Sem qualquer ajuste fino nos pesos originais do Qwen/Qwen3-1.7B, o modelo de passe único obteve uma acurácia de base de 0.5938 (atingindo 725 acertos em 1.221 avaliações) e uma métrica macro F1 de 0.5844.
O detalhamento estatístico desse teste inicial revelou o desempenho isolado para cada uma das cinco alternativas distribuídas no conjunto de dados, demonstrando dispersão expressiva entre sensibilidade e precisão conforme exposto nos dados da avaliação:
Considerando que se trata de uma arquitetura compacta de apenas 1,7 bilhão de parâmetros operando sob inferência de passe único, Nish Tahir classificou os resultados como promissores. Na sequência do experimento, o autor aplicou um procedimento rápido de fine-tuning sobre a base de treinamento do próprio CommonsenseQA, elevando a performance geral para 762 acertos em 1.221 testes, o que consolidou uma acurácia de 0.6241 (62,41%) e ampliou o macro F1 para 0.6234.
A reavaliação pós-treinamento demonstrou ganhos expressivos no equilíbrio entre precisão e revocação nas classes que antes sofriam com baixa sensibilidade. Na alternativa D, a taxa de revocação subiu de 0.3904 para 0.5418 com F1 de 0.5991, enquanto a opção E saltou de uma revocação de 0.4255 para 0.6426, alcançando F1 de 0.6101 sob a mesma base balanceada de suporte original.
Apesar da evolução nos índices globais de acerto com o ajuste fino, Nish Tahir expôs uma fragilidade severa inerente à interpretação direta dos valores de probabilidade: a falta de calibração estatística do modelo. O problema ficou nítido ao submeter ao sistema um enunciado inerentemente ambíguo: "Where would you most likely find a bat?" (Onde você mais provavelmente encontraria um morcego/taco?), trazendo como opções A: "Cave" (Caverna), B: "Baseball game" (Jogo de beisebol), C: "Attic" (Sótão), D: "Zoo" (Zoológico) e E: "Sporting goods store" (Loja de artigos esportivos).
Devido à polissemia da palavra de língua inglesa "bat" (que pode significar o mamífero voador ou o equipamento esportivo), o cenário não possui uma resposta unívoca e objetiva. No entanto, o cálculo direto da camada softmax produziu um índice de 0.9978 (99,78%) para a alternativa A (Cave), relegando 0.0017 para Attic, 0.0004 para Baseball game, 0.0001 para Sporting goods store e 0.0000 para Zoo. O modelo demonstrou uma certeza quase absoluta em um dilema fundamentalmente contextual e indeterminado.
Para auditar formalmente a extensão desse comportamento em larga escala, o pesquisador agrupou os índices de confiança das predições do CommonsenseQA em intervalos de probabilidade de dez pontos percentuais (bins). Os números revelaram uma superconfiança generalizada, evidenciando que a convicção expressa matematicamente pela rede não correspondia à sua precisão empírica real:
Os dados comprovaram de forma contundente que, quando o modelo emitia respostas situadas no intervalo de confiança entre 0.80 e 0.90, sua precisão prática era inferior a metade desse valor, acertando em apenas cerca de 47% das ocorrências. Da mesma forma, nos casos em que exibia confiança extrema acima de 0.90, errava três a cada dez vezes avaliadas, tornando os números brutos inviáveis para decisões críticas de negócio.
Para mitigar a distorção sem a necessidade de reprocessar o treinamento de pesos sinápticos, Nish Tahir adotou a técnica de escalonamento de temperatura (temperature scaling). O procedimento matemático introduz um hiperparâmetro escalar denominado temperatura T no denominador dos logits antes da aplicação da função softmax. Ao modular o valor de T, a curva de distribuição probabilística é suavizada e achatada, redistribuindo a densidade de certeza de maneira mais harmônica com o histórico de acertos observados.
Por meio de algoritmos de ajuste de curvas (curve fitting) calibrados contra a acurácia do conjunto de dados, Nish Tahir identificou o valor numérico ideal de temperatura em 3.797280788421631. A aplicação desse divisor escalar reajustou a distribuição das pontuações, promovendo um alinhamento direto e fidedigno entre o grau numérico de certeza emitido e o desempenho real de validação do modelo:
O alinhamento alcançado com o fator T = 3.797280788421631 corrigiu o problema da superconfiança do Qwen/Qwen3-1.7B. Na faixa superior de 0.90 a 1.00, a precisão observada (0.9541) passou a espelhar perfeitamente a pontuação de saída (0.9333), e no intervalo intermediário de 0.50 a 0.60, a paridade entre a confiança calculada (0.5475) e a taxa de acerto real (0.5482) atingiu precisão estatística quase idêntica.
Para assegurar a reprodutibilidade dos experimentos por outros pesquisadores e engenheiros de aprendizado de máquina, Nish Tahir disponibilizou publicamente um repositório no GitHub contendo todos os scripts utilizados em sua pesquisa. A suíte de código aberta documenta detalhadamente as etapas essenciais do ciclo de vida desse padrão arquitetural, compreendendo a construção do conjunto de dados, a avaliação estruturada de desempenho, o pipeline de ajuste fino (fine-tuning) e o algoritmo de calibração via curve fitting.
O autor enfatizou o convite para que a comunidade de tecnologia clone o repositório e teste a mesma metodologia em modelos de linguagem com maior número de parâmetros que superem o porte do Qwen3-1.7B utilizado no artigo original. Com a consolidação das arquiteturas de passe único e decodificação restrita, o método oferece uma alternativa computacionalmente econômica para fluxos de triagem e tomada de decisão automática de baixa latência em produção.
Anthropic suspende acesso à internet em testes internos após agentes de IA explorarem falhas de software e enviarem denúncia falsa à polícia.
Agentes autônomos de IA passam a operar via SMS, iMessage e WhatsApp, executando tarefas reais e movimentando rodadas de bilhões de dólares no mercado.
Apple notifica Comissão Europeia sobre contratação de talentos da Huxe e licenciamento de tecnologia de podcasts personalizados em IA.