Detector de IA funciona de verdade? Os limites do GPTZero e do Originality.ai
RESUMO | Detectores de IA como GPTZero, Originality.ai e Turnitin analisam padrões estatísticos da escrita para estimar se um texto saiu de um modelo de linguagem. Têm desempenho melhor em textos longos gerados por IA e pouco editados, mas erram com textos humanos formais e com conteúdos revisados. O percentual exibido não prova autoria, mas serve para abrir uma revisão.
Um detector de IA estima a probabilidade de um texto ter sido produzido por um modelo de linguagem, sem acesso à conta do autor nem ao histórico de conversas com o ChatGPT. Em julho de 2023, a própria OpenAI reconheceu o limite desse método ao desativar seu classificador de texto, após constatar que ele reconhecia apenas 26% dos textos de IA e marcava 9% dos textos humanos como artificiais.
Os detectores evoluíram desde então, mas seguem um princípio parecido. O resultado serve como ponto de partida para profissionais que recebem grande volume de textos que precisam ser avaliados ou editados, mas ainda são necessárias outras evidências para bater o martelo com 100% de certeza.
Como funciona um detector de IA?
O detector compara o texto enviado com padrões que o sistema aprendeu a associar à escrita humana e às respostas de modelos como ChatGPT e Gemini.
Um dos fatores que pesa na análise é a previsibilidade. Isso porque os textos com escolhas de palavras muito esperadas se aproximam do que um modelo de linguagem produziria. Só que gêneros formais, técnicos e acadêmicos também são previsíveis por natureza.
Outro ponto é a variação, em que o sistema mede a alternância no tamanho das frases e no vocabulário. Uma pessoa pode escrever de forma regular, e uma IA pode gerar texto irregular depois de um prompt detalhado.
Sendo assim, um resultado de "80% IA" não indica que 80% do texto foi gerado por máquina, nem que há 80% de chance de o autor ter usado o ChatGPT. O número é uma classificação do software, que varia conforme o idioma e o limiar de corte definido pela empresa. O NIST, órgão de padrões técnicos dos Estados Unidos, alerta que ler essa pontuação como probabilidade direta leva a falsos positivos.
Detecção de IA também não é detecção de plágio. Um texto original, sem nenhum trecho copiado, pode ser classificado como IA, e um texto escrito por uma pessoa pode conter plágio.
Detector de IA funciona de verdade?
Funciona em condições controladas, mas não com confiabilidade suficiente para decidir sozinho uma questão de autoria. Em um estudo piloto de 2024, o NIST testou a capacidade de detectores de separar resumos humanos de resumos gerados por IA. Alguns tiveram bons resultados, mas o desempenho mudou conforme o modelo gerador, e três geradores conseguiram enganar todos os detectores avaliados.
A escala agrava o problema. Uma taxa de falso positivo de 1%, aplicada a 10 mil redações, significa cerca de 100 pessoas acusadas por engano. Em orientação a educadores, a OpenAI afirma que nenhum detector testado pela empresa mostrou confiabilidade para decisões com consequências duradouras e que pequenas alterações no texto bastam para driblar esses sistemas.
O que dizem os números do GPTZero e do Originality.ai?
Os dois serviços divulgam índices de acerto acima de 99%, mas os principais números vêm de testes conduzidos pelas próprias empresas.
O GPTZero surgiu em janeiro de 2023 com foco em educação e analisa o texto frase a frase. Em fevereiro de 2026, publicou um benchmark próprio com 99,76% de acurácia, 99,60% de recall e 0,08% de falso positivo em quatro tipos de texto. A empresa reconhece que nenhum detector acerta 100% das vezes.
O Originality.ai atende editoras e equipes de SEO que processam muito conteúdo e soma checagem de plágio e de fatos à detecção de IA. Em 2026, divulgou uma comparação em que seu detector acertou 100% de uma amostra com textos humanos e textos de ChatGPT, DeepSeek, Gemini e Grok. A empresa admite que o sistema pode gerar falsos positivos.
Antes de confiar em um índice de precisão, quatro perguntas ajudam a medir o peso do teste:
- Quem conduziu o estudo: a própria fornecedora ou uma instituição independente;
- Qual idioma foi usado: resultados em inglês não se transferem para o português;
- Que tipo de texto entrou na amostra: redação escolar, artigo científico ou reportagem com entrevistas;
- Se houve conteúdo misto: textos escritos por pessoas e revisados por IA são os mais difíceis de classificar.
Detectores de IA funcionam em português?
O GPTZero informa suporte a mais de 20 idiomas, incluindo o português, e lançou em maio de 2025 uma atualização do modelo multilíngue com falso positivo declarado abaixo de 1%. O Originality.ai orienta usuários de idiomas que não o inglês a selecionar o modelo multilíngue antes da análise.
Suporte declarado, porém, não equivale a validação. Um estudo publicado em 2025 nos anais da Sociedade Brasileira de Computação (SBC) testou cinco detectores (ZeroGPT, JustDone, Writer, SEO AI Detector e Summarizer) com 50 manuscritos científicos em português, humanos e gerados por ChatGPT, Gemini e DeepSeek. O ZeroGPT teve o melhor desempenho, mas ainda classificou textos humanos como IA. Os demais mostraram baixa sensibilidade ou alta taxa de falsos positivos.
GPTZero e Originality.ai não fizeram parte da amostra, mas o estudo mostra que os erros em português não são hipotéticos.
Por que um texto humano é marcado como IA?
Alguns estilos de escrita têm mais chance de receber a marcação:
- Textos formais: trabalhos acadêmicos, relatórios corporativos, pareceres jurídicos e documentos institucionais;
- Conteúdo padronizado: descrições de produto, definições e textos de SEO;
- Textos curtos: amostras pequenas dão menos material para a análise;
- Escrita em segunda língua ou traduzida: a construção tende a ser mais regular.
O Turnitin, usado por universidades, reconhece que seu modelo pode confundir texto humano com texto de IA parafraseado. Desde 2024, pontuações entre 1% e 19% aparecem no relatório com asterisco e sem o número exato, porque essa faixa concentra mais falsos positivos.
O erro também acontece no sentido oposto. Um texto de IA reescrito por uma pessoa, misturado a trechos humanos ou complementado com entrevistas e dados próprios tende a escapar da detecção. E cada novo modelo de linguagem obriga os detectores a se atualizar, o que faz os índices de precisão envelhecerem em poucos meses.
O que fazer se o detector acusar seu texto de IA?
Rodar o mesmo texto em dezenas de detectores não resolve a discussão, porque os resultados divergem entre si. O caminho mais eficaz é reunir provas do processo de escrita:
- Histórico de versões: Google Docs, Word e Notion registram as edições feitas ao longo do tempo;
- Rascunhos e anotações: fichamentos, esboços e versões intermediárias mostram como o texto evoluiu;
- Material de apuração: fontes consultadas, entrevistas e planilhas usadas na produção;
- Declaração de uso de IA: se houve apoio em etapas como correção ou tradução, informar conforme a regra da instituição ou do cliente.
O Turnitin afirma que seu indicador não deve ser a única base para medidas contra estudantes, argumento útil para pedir revisão humana do caso.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.