Como o Probator deteta texto escrito por IA, e como evitamos acusações injustas
Os sinais por trás de cada resultado de deteção de IA, porque preferimos dizer «inconclusivo» a acusar quem escreveu, e onde encontrar os nossos valores de precisão.
Um resultado de deteção de IA pode afetar uma nota, uma candidatura a emprego ou a relação com um cliente. Por isso construímos o Probator em torno de uma regra: um «gerado por IA» errado é pior do que um «inconclusivo» honesto. É assim que funciona uma verificação.
Vários sinais independentes
- O nosso próprio modelo de deteção. Um classificador treinado com textos humanos e de IA em seis línguas, incluindo textos melhorados por IA e textos escritos para «parecerem humanos». Avalia cada frase e o documento inteiro.
- Uma leitura especializada. Um modelo de linguagem lê o texto frase a frase e cita as passagens que parecem escritas por máquina, com as razões.
- Um teste de reescrita. Pedimos a um modelo que melhore o texto. O texto escrito por máquina volta quase igual; a escrita humana é bastante alterada.
- Provas forenses. Restos de chatbot («Como modelo de linguagem…»), caracteres invisíveis, letras semelhantes, metadados que nomeiam ferramentas de IA e marcas de IA legíveis por máquina, como as Credenciais de Conteúdo.
Salvaguardas contra falsos positivos
A escrita formal, traduzida ou de não nativos é a mais vezes mal avaliada. Antes de dizermos que um texto foi gerado por IA, aplicam-se três salvaguardas:
- Demasiado curto para avaliar. Com menos de 80 palavras, não dizemos «gerado por IA», salvo se houver provas inequívocas.
- Dois detetores têm de concordar. Se só um sinal tiver confiança, o resultado é «provavelmente», nunca «gerado por IA».
- Calibrado por língua. O limiar do nosso modelo em cada língua é definido para que, nos dados de validação, no máximo 1 em cada 100 documentos humanos seja assinalado. Se o modelo não detetar escrita de IA, o resultado é «inconclusivo».
Quando uma salvaguarda altera um resultado, o relatório indica-o.
Publicamos a nossa precisão
Cada modelo que pomos em uso é testado com documentos que nunca viu durante o treino, e os resultados estão na nossa página de precisão, por língua. Os nossos relatórios mensais mostram, de forma anónima, como se distribuem os resultados de todas as verificações.
O que um resultado não é
É uma probabilidade com razões, não uma prova de autoria. Se avalia o trabalho de outras pessoas, leia as razões, veja rascunhos e outras provas, e dê ao autor a oportunidade de se explicar. A nossa Política de IA define as regras.