Yapay Zekâ Metin Dedektörleri Taklit Karşısında Şaşırıyor

Epoch AI'nin testine göre Pangram, GPTZero ve Originality.ai, bir yazarın stilini taklit eden yapay zekâ metinlerinin %18'ini, akademik yazıda ise %48'ini tespit edemedi.

Yapay Zekâ Metin Dedektörleri Taklit Karşısında Şaşırıyor
Görsel: The Decoder
Okuma Süresi: 2 dk
Selin ÖlçerRakamlar konuşur, o tercüme eder
Yapay zeka destekli müstear kalem · Editoryal sorumluluk: Osman Aslan

Yapay zekâ metin dedektörleri, sıradan bir istemle üretilmiş içeriği yakalamakta neredeyse kusursuz bir performans gösteriyor. Ancak Epoch AI'nin yeni araştırması, bu tabloyu ciddi biçimde sarsıyor: bir dil modeline gerçek bir yazarın örnek metinleri verilip "bu stilde yaz" dendiğinde, en popüler dedektörler bile şaşırtıcı ölçüde kör kalıyor. Sayılar tesadüfi değil; sistematik bir kör nokta işaret ediyor.

Epoch AI ekibi, üç yaygın kullanılan dedektörü — Pangram (v3.3.2), GPTZero (2026-05-11-base) ve Originality.ai (Turbo 3.0.2) — 99 yazardan derlenen 495 insan metniyle test etti. Metinler kasıtlı olarak ChatGPT'nin Kasım 2022'deki lansmanından önce yazılmıştı; böylece eğitim verisi kirlenmesi ihtimali büyük ölçüde ortadan kalkıyor. Testler blog yazısı, kurmaca ve bilimsel yazım olmak üzere üç kategoride yürütüldü.

Sonuçlar, sade istemle üretilen metinlerde neredeyse mükemmeldi: yanlış negatif oranı en fazla %0,7'de kaldı. İnsan metinlerinde de Pangram ve GPTZero tek bir yanlış alarm vermedi; Originality.ai ise 495 insan metninden 19'unu hatalı biçimde yapay zekâ ürünü olarak işaretledi — %3,8'lik dikkat çekici bir yanlış pozitif oranı.

Taklit Devreye Girince Tablo Değişiyor

Araştırmacılar, Claude Opus 4.8, GPT-5.5 ve Gemini 3.1 Pro'ya her bir yazardan beş örnek metin vererek aynı üslupta yeni içerik ürettirdi. 297 üretilen metinden ortalama 38'i tespit edilemedi; bu da ortalama %13'lük bir yanlış negatif oranına denk geliyor. Dedektörler arasında Pangram %10, GPTZero %11 ile en iyi performansı gösterirken Originality.ai %18 ile en geride kaldı.

Kurmaca metinlerde kaçırma oranı %1-5 bandında kalarak makul görünüyor. Ama bilimsel yazımda tablo tersine döndü: Pangram taklit edilmiş akademik metinlerin %25'ini, GPTZero %24'ünü, Originality.ai ise %29'unu yakalayamadı. En kötü senaryo, Pangram'ın Gemini'nin ürettiği akademik metinlerin %48'ini kaçırmasıyla ortaya çıktı. Originality.ai tarafında ise GPT-5.5 kaynaklı akademik metinlerin %39'u tespit dışı kaldı.

Dedektörlerin çalışma mantığı farklı olsa da sonuç örtüşüyor. Pangram, kararlarını tam olarak açıklayamayan bir sinir ağı kullanıyor; kurucusu sistemin bir "kara kutu" olduğunu kabul ediyor. GPTZero, kelime seçimlerinin öngörülebilirliğini ve metin içi tutarlılığı ölçüyor — insanların yapay zekâdan daha "düzensiz" yazdığı varsayımına dayanıyor. Originality.ai ise eğitim verisinden öğrendiği istatistiksel örüntüleri arıyor. Yöntem farklı, sonuç aynı: basit istemi yakalıyorlar, taklidi kaçırıyorlar.

Bu Ne Anlama Geliyor?

Bu bulgu, dedektörlerin en çok kullanıldığı alanla tam olarak çakışıyor. Akademik camia, intihal ve yapay zekâ destekli yazım şüphesini bu araçlarla test ediyor; oysa veriler, tam da bilimsel metin kategorisinde en yüksek hata oranının ortaya çıktığını gösteriyor. Daha önce Authors Guild'in yaptığı bir test, Pangram ve Originality.ai'nin insan metinlerini güvenilir biçimde "insan" olarak sınıflandırdığını ortaya koymuştu. Epoch AI'nin çalışması ise resmin diğer yarısını tamamlıyor: düşük yanlış alarm oranı, kaçırılan yapay zekâ metinlerinin sayısı hakkında hiçbir şey söylemiyor. Kısacası bu araçlara "kanıt" muamelesi yapmak, henüz doğrulanmamış bir güvenilirlik seviyesine güvenmek anlamına geliyor.

Eğitim kurumları ve akademik yayınevleri için pratik sonuç açık: bu dedektörlerin verdiği "temiz" raporu, bir yazarın stilini öğrenmiş bir modelin devreye girmediğinin garantisi saymak riskli. Özellikle üniversite ve dergi düzeyinde, tek bir araca dayanan otomatik karar mekanizmaları, %48'e varan kaçırma oranıyla yanlış güven verebilir. Bu da metin tespiti pazarındaki üç büyük oyuncunun (Pangram, GPTZero, Originality.ai) rekabetini teknik doğruluk yerine pazarlama iddialarına kaydırma riski taşıyor.

Sık Sorulan Sorular

Epoch AI'nin testinde hangi dedektörler karşılaştırıldı?
Pangram (v3.3.2), GPTZero (2026-05-11-base) ve Originality.ai (Turbo 3.0.2) test edildi; her üçü de sade istemle üretilen metinlerde yüksek doğruluk gösterirken stil taklidinde performans kaybetti.
Stil taklidi ne anlama geliyor?
Bir dil modeline belirli bir yazarın beş örnek metni verilip aynı üslupta yeni içerik ürettirilmesi anlamına geliyor; bu senaryoda dedektörlerin ortalama yanlış negatif oranı %13'e çıktı.
Hangi yazı türünde tespit oranı en düşük çıktı?
Bilimsel yazımda tespit başarısızlığı en yüksek seviyeye ulaştı; Pangram, Gemini'nin ürettiği akademik metinlerin %48'ini kaçırdı.
Bu sonuçlar eğitim kurumları için ne anlama geliyor?
Dedektörlerin düşük yanlış alarm oranı, insan metinlerini doğru sınıflandırdıklarını gösterse de, akademik metinlerde yüksek kaçırma oranı nedeniyle tek başına güvenilir kanıt sayılmamaları gerekiyor.

Kaynak: The DecoderBu haber, kaynaktaki gelişme temel alınarak Yapay Zekanın Nabzı editoryal süreciyle hazırlanmıştır.

yapay zekametin tespitiakademik yazımEpoch AIPangramGPTZero

Yapay zeka gündemini kaçırma 🤖

Günün tüm haberleri, yayınlandığı anda Telegram kanalında.

✈️ Kanala Katıl

Son Haberler