- 12.750 arXiv makalesinin tüm metni analiz edildiğinde, güncel makalelerin yaklaşık üçte birinin makine tarafından yazılmış gibi okunduğu ve son tamamlanmış çeyrekte saptama oranının yaklaşık %32 olduğu görüldü
- 2021~2022 makaleleri insan yazımı kontrol grubu olarak alınıp eşik %0,4 yanlış pozitif oranına göre ayarlandı; sürüm 1 PDF’leri ve bootstrap yöntemiyle %95 güven aralıkları kullanıldı
- ChatGPT’nin ortaya çıkışından sonra saptama oranı iki kez yükselerek 2026 başında yaklaşık %39 ile zirve yaptı; Temmuz 2026’ya kadar son 12 ay bazında bilgisayar bilimleri %65,0, matematik ise %0,7 oldu
- Çok sayıda formül ile teorem–ispat yapısı içeren matematik makaleleri, dedektörün eğitim dağılımından farklı olduğu için düşük ölçülebilir; gerçek yazarların kullandığı kapalı model–prompt kombinasyonları üzerindeki performans da değerlendirilemiyor
- Saptama sonuçları yazarı veya yapay zeka üretimi oranını belirleyemez ve hafif düzenleme ile tamamen üretimi ayırt edemez; bu nedenle kişileri suçlamak için değil, makinevari üslup oranının alt sınırı olarak yorumlanmalıdır
Yanlış pozitif oranını temel alan ölçüm tasarımı
- “İçeriğin %N’i yapay zeka” gibi bir sayı, dedektörün gerçek insan belgelerini de aynı şekilde işaretleme oranı görülmeden çok değerli değildir
- Yeni makalelerin %40’ını makine yazımı olarak işaretlerken ChatGPT öncesi makalelerin %20’sinde de aynı sonuç çıkıyorsa, önce açıklanması gereken sayı %20 yanlış pozitif oranıdır
- Dedektör akademik üsluba göre kalibre edildi
- %0,4 yanlış pozitif oranında, LLM öncesindeki gerçek bilimsel belgelerin %99,6’sını normal şekilde geçirir
- Yapay zekanın yazdığı akademik belgelerin %85’ini saptar
- 2021~2022’de gönderilen makaleler insan yazımı doğru veri olarak kabul edildi ve eşik, tam olarak yalnızca %0,4’ü işaretlenecek şekilde ayarlandı
- Tüm sonuçlar, tasarım gereği LLM öncesi belgelerde %0,4’te kalan eşiği aşan makalelerin oranıdır
- ChatGPT öncesi yıllar yerleşik kontrol grubu işlevi görür
- Artış, dedektörün kendisinden kaynaklanan yapay bir sonuç olsaydı 2021~2022 de 2026 kadar yüksek çıkmalıydı; gerçekte böyle olmadı
Örneklem ve analiz yöntemi
- 10 alan grubunda Ocak 2023’ten Temmuz 2026’ya kadar alan ve ay bazında yaklaşık 25 makale örneklendi; 2021~2022’den 8 aylık kontrol grubu eklenerek toplam 12.750 makale analiz edildi
- 2026’da revize edilen ifadelerin ilgili makalenin 2023 örneklemine karışmaması için her makalenin sürüm 1 PDF’i kullanıldı
- Özet yerine tüm metin analiz edildi
- Aynı makalede özet kısmında %20’nin altında, gövde metninde %70’in üzerinde çıkan örnekler olduğundan yalnızca özeti analiz etmek sinyali zayıflatabilir
- Tüm sayılara bootstrap yöntemiyle %95 güven aralığı uygulandı
Genel eğilim ve alanlar arası farklar
- Saptama oranı 2021~2022 boyunca %0,4’te kaldı, ChatGPT’nin ortaya çıkışından sonraki birkaç ay içinde yükselmeye başladı
- Ardından iki kez artarak son tamamlanmış çeyrekte yaklaşık %32 kaydetti; 2026 başında yaklaşık %39 ile zirve yaptı
- Temmuz 2026’ya kadar son 12 ayın alan bazlı sonuçları şöyle
| Alan | LLM öncesi kontrol grubu | Güncel saptama oranı | %95 güven aralığı |
|---|---|---|---|
| Bilgisayar bilimleri | %0,2 | %65,0 | %59,3~70,3 |
| Nicel biyoloji | %3,5 | %56,3 | %51,0~61,7 |
| Elektrik mühendisliği ve sistemler | %1,7 | %51,3 | %46,0~57,0 |
| Ekonomi ve finans | %2,5 | %47,0 | %41,3~52,7 |
| Uygulamalı fizik | %1,3 | %34,0 | %29,0~39,7 |
| İstatistik | %1,8 | %31,3 | %26,0~36,7 |
| Yoğun madde fiziği | %0,0 | %24,0 | %19,3~29,0 |
| Yüksek enerji fiziği | %0,5 | %14,0 | %10,0~18,0 |
| Astrofizik | %0,0 | %10,7 | %7,3~14,3 |
| Matematik | %0,0 | %0,7 | %0,0~1,7 |
- Bilgisayar bilimleri yaklaşık %65 ile en yüksek, matematik yaklaşık %0,7 ile en düşük; ancak matematiğin düşük değerini yorumlamak zor
- Kontrol grubu sütunu, her alanın 2021~2022 saptama oranlarının üç duyarlılık ayarı üzerinden alınan ortalamasıdır
- Artışın büyük olduğu alanlarla LLM öncesi kontrol grubu seviyesi yüksek olan alanlar örtüşmediğinden, sonraki yükseliş yalnızca yüksek başlangıç noktasıyla açıklanamaz
Alan bazlı kontrol gruplarının istatistiksel sınırları
- Her alan için ChatGPT öncesi kontrol grubu 200 makaledir
- %0,4 yanlış pozitif oranında 10 alandaki 2.000 kontrol makalesi içinde yalnızca 8 makale işaretlendiği için tek bir eşiğe dayalı alan bazlı oranlar kabaca ölçülür
- Birleştirilmiş toplamda yanlış pozitif alt sınırı yeterince tahmin edildi ve araştırma tasarımı da bunu temel alıyor; ancak alan bazlı kontrol grubu sayıları yalnızca yaklaşık değerlerdir
- Alan bazında %1’in altındaki oranları hassas biçimde sabitlemek için her alanda binlerce kontrol makalesi gerekir; ancak 2023 öncesi arXiv’de bunu karşılayacak sayıda makale yoktur
Düşük puanlar ve dedektörün kör noktaları
- Düşük puan, yapay zeka benimseme oranının düşük olduğu anlamına gelebilir ya da dedektörün kör noktalarını yansıtıyor olabilir
- Matematik makaleleri formüller ve teorem–ispat yapıları üzerine kuruludur; formüller ve kaynakçalar çıkarıldığında geriye az miktarda düzyazı kalır ve bu da dedektörün eğitildiği bilimsel İngilizceden farklıdır
- Modelden yoğun yardım alınarak yazılmış matematik makaleleri bile düzyazısı dedektörün dağılımı dışında kaldığı için düşük puan alabilir
- Bu nedenle yalnızca matematik sonuçlarına bakarak düşük benimseme ile düşük saptama duyarlılığını ayırt etmek zordur
- Düzyazı oranı yüksek olup dedektörün eğitim dağılımına en iyi uyan alanlarda en büyük artış görüldüğünden, bu karıştırıcı etken tek başına genel yükseliş eğilimini açıklayamaz
- Düşük puanlı alanların sıralaması, yapay zeka benimseme oranının alt sınırı olarak okunmalıdır
- Dedektörün duyarlılığı üretici modele göre değişir; yazarların gerçekte kullandığı kapalı modellerin ve prompt’ların tam kombinasyonu değerlendirilemez
- Eksik saptama kapsamı saptama oranını düşürdüğü için ölçülen oran, gerçek makinevari üslup oranının alt sınırıdır; üreticiye göre performans dedektör açıklamasında görülebilir
Saptama sonuçlarının söyleyemediği şeyler
- Dedektör, bilinen hata oranları ve kalibre edilmiş olasılıklar temelinde bir belgenin makine yazımı gibi okunup okunmadığını tahmin eder
- Hafifçe düzenlenmiş belgelerle tamamen üretilmiş belgeleri ayırt edemez; tek bir puan belirli bir kişiyi suçlamak için dayanak olamaz
- Ölçülen şey yazar kimliği veya üretim oranı değil, yapay zekadan yoğun yararlanılmış düzenlemeleri de kapsayan makinevari üslup oranıdır
- arXiv makaleleri ücretsiz kontrol sayfasında, genel metinler metin kontrol sayfasında kontrol edilebilir; dedektörün işletilmesinden gelir elde edilmiyor
1 yorum
Hacker News görüşleri
2011'de yazdığım PyHPC atölye makalesi %27 makine tarafından yazılmış, 2012'deki doktora tezim ise eşik değer olan %42'nin hemen altında, %40 olarak sınıflandırıldı.
Artık makale yayımlamıyorum ama benim LLM gibi mi yazdığımı, yoksa LLM'in benim yazılarımdan mı öğrendiğini bilmiyorum. 2015 IEEE CLUSTERS makalesi ise tam %74 çıktı.
Daha tehlikelisi, nasıl çalıştığını bilmeyen insanların bunlara dayanarak AI kullanıldığını kesin kabul edip öğrencilere ciddi zarar vermesi; bu zaten eğitimin her kademesinde yaşanıyor.
2021-2026 arasındaki 12.750 arXiv makalesinin tam metni analiz edilerek makine tarafından yazılmış olarak sınıflandırılan oran ve ChatGPT'nin çıkışından sonraki artış incelendi.
Yanlış pozitiflerden kaçınmak için dedektör bilinçli olarak ayarlanmış; ChatGPT öncesi tespit oranı yaklaşık %0,4 olmuş. Ocak 2026'da tüm makalelerin yaklaşık %39'u, bilgisayar bilimlerinde ise en fazla %65'i AI tarafından yazılmış olarak sınıflandırılmış; matematik %0,7'den neredeyse kıpırdamamış, ancak ispat odaklı üslubu düzgün yakalayamamış olabilir. Bu yalnızca istatistiksel bir sinyal tahminidir, belirli bir yazarın AI kullandığının kanıtı değildir; makine yazımı güçlü AI destekli düzenlemeyi de kapsayabilir.
ChatGPT öncesi belgelerin pozitif eğitim verisine dahil edilmesi gibi bir sızıntı olabilir.
LLM'ler ortaya çıkmadan önce de çok az sayıda yazarın LLM gibi yazıp yazmadığını merak ediyorum.
Çok sayıda makaleyi kontrol ederken sunucuya aşırı yük bindirmek istemem.
Şirketlerde LLM kullanımında gerçekten oyun teorisi temelli teşvikler işliyor.
Geliştiriciler Claude Code'u her yerde kullanıp görünürde daha iyi kod ve dokümantasyonu bolca üretiyor, yönetim de kısa vadede olumsuz taraf görmediği için bunu teşvik ediyor. Yapısal kalite belirsiz, ama yanlış metriklerle yalnızca üretim miktarı göründüğünden, bilişsel yeteneklerin körelmesini göze almaya değip değmediğini anlamak yıllar sürecek. Bütün gün LLM kullanmayan biri üretim miktarında geride kalmaya mahkûm; yayın sayısının önemsendiği bilim dünyasında da aynı baskının işlemesi çok olası.
Buna rağmen çok sayıda startup ve yeni yardımcı doçent “AI” ile yeni alanlar açtığını öne sürüyor; gerçekte ise en etkili yaklaşım LLM'den çok makine öğrenmesi kullanıyor.
Yinelenmeyi en aza indirme ve kodu küçültme hedefiyle sürekli talimat verdim ama sonuç daha çok “berbat olsa da benim için işe yarıyor” seviyesinde. Bu kadar faydayı bile göz ardı edemem; fakat taşan bir tuvalete bakıp değerin maksimize edildiğini sanan yönetim beni korkutuyor.
Asıl zor soru harcanan zaman ve maliyete karşı kalite; şu an abonelik ücreti bazında opus/fable tarafından üretilen kodun yeterince avantajlı olduğunu düşünüyorum.
Yeni aracın kendisi iyi, ama yönetim metriklerini tutturmak için belirli bir aracı kullanmaya zorlanmaktan hoşlanmıyorum.
İnsanlar AI'a bağımlı hale geldiğinde şirketler yasaları kendi lehlerine değiştirecek nüfuzu elde eder. Vatandaşlar şehir merkezindeki dev veri merkezlerine karşı çıksa bile, şirketler o veri merkezlerinin sağladığı AI olmadan hiçbir şey yapamayacaklarını söyleyerek baskı kurabilir; bu yüzden insanları yetersiz ve bağımlı hale getirmek kilit nokta olabilir.
Yalnızca metin kullanan tüm AI tespit yöntemlerinde olduğu gibi doğruluk endişe verici.
Özellikle üç dedektör puanını en sonda birleştirme sürecinin önyargı yaratmadığından nasıl emin olunduğunu bilmiyorum; kaynak kodu olmadığı için nasıl çalıştığını incelemek ya da araştırmayı yeniden üretmek de zor. LLM öncesinde bizzat yazdığım yayımlanmamış bir çalışma da yüksek puan aldı; başka bir makalede neredeyse her cümle kırmızı “machine-leaning” olarak işaretlenmesine rağmen puanı etkilemedi. Aynı metnin puanı LaTeX biçimlendirmesi olup olmamasına göre de ciddi biçimde değişti. Sonuç şu olmalı: “Üretilmiş metni tespit etmek zordur; sadece hipotezi doğruluyor diye sonuçlar kabul edilmemelidir.” Bu yazıyı da az önce kendim yazdım ama makine yazımı puanı yüksek çıkıyor.
Akademik ortamda aynı soruna bakıldığında, yalnızca metinden yapay zeka yazımını güvenilir biçimde tespit etmenin imkânsız olduğu sonucuna varılmış
Bir insan ve bir LLM tesadüfen tamamen aynı paragrafı yazdıysa, tek bir girdiyi sentetik ve insan yazımı diye ayırmanın yolu yoktur. Gerçekte LLM'lere özgü izler vardır, ancak bunlar zamana ve modele göre değiştiği için sentetik gibi görünen insan yazılarıyla insan gibi görünen sentetik yazıları ayırt etmek mümkün değildir. Daha ilginç yaklaşım, deneme derlemlerinde sözcük dağarcığının, dilsel özelliklerin, üslup gömmelerinin, genel gömmelerin, yazım hatalarının, hataların ve kaynakçaların LLM'lerin devreye girmesinden sonra nasıl değiştiğini analiz etmektir. Topluluk düzeyinde akademik üslubun değiştiği açık, ancak nedenini izlemek zor
Chomsky'nin dediği gibi, bir insanın söylediği ya da anladığı neredeyse her cümle, evren tarihinde ilk kez ortaya çıkan bir sözcük birleşimidir. Daha büyük zorluk, LLM'lerin tek bir sabit ifade üretmemesi ve metnin bilgi yoğunluğunun düşük olması nedeniyle dar güven aralıklarıyla istatistiksel test yapmak için kayda değer miktarda metne ihtiyaç duyulmasıdır
Okunan makalelerin %65'i yapay zeka yazımı özellikleri gösteriyorsa, doğrudan yapay zeka kullanılmasa bile yapay zeka üslubunun etkisi altında kalınır
Bu etkinin, özellikle üslubu hâlâ oluşmakta olan yeni araştırmacılarda daha güçlü görülme olasılığı yüksektir
Bir insanın yapay zekanın sözdizim kalıplarını uzun süre koruyabilmesi için, şu anda kimsenin tam olarak bilmesi zor olan kalıpları kavraması ve her yan cümleyi bir tablo sahteciliği gibi ince ince ayarlaması gerekir. Ayrıca yapay zeka üslubu da değişiyor; tipik işaretlerden biri olan delve, 2024 ortasından sonra keskin biçimde azaldı ve artık LLM çıktılarında neredeyse yok oldu. Bunu öğrenip izleyen insanların yazıları, aksine güncel yapay zeka üslubuna daha az benzer hâle gelir
Yapay zekadan önce de laf kalabalığı üreten insanlar vardı
Ana dili İngilizce olmayan biri olarak, makalelerin çoğunun yapay zeka tespit araçlarına takılması şaşırtıcı değil
Bunun nedeni LLM'den makalenin tamamını yazmasını istemek değil; bilimsel üsluba alışık olmamak ve Amerikalı editörlerin bunu talep etmesidir. Fikirleri temel cümlelerle yazıp LLM ile akıcı hâle getirebilirsiniz. Her paragrafı kendiniz yazdıktan sonra daha bilimsel biçimde cilalarsanız, içerik bütünüyle size ait olsa bile LLM üretimi diye sınıflandırılır. Tersine, İngilizceyi yeterince iyi cilalarsanız LLM'nin yazdığı bir makale de insan yazısı gibi görünebilir
Yeniden makale yazacak olsam her şeyi elle yazmayı düşünmem; içeriğin niyetimle uyuştuğunu doğrular ve yanlış yazılmış yerleri düzeltirsem sorun yok. Ana dili İngilizce olanların yazdığı makaleler arasında da LLM ile yeniden yazılsa çok daha iyi olacak çok sayıda metin var
Her paragraftaki ayrıntılı ifadeler neyin nasıl aktarıldığı üzerinde büyük etkiye sahiptir; bu yüzden bütünüyle kişinin kendi makalesi saymak zordur. Zaten bilimsel görünen bir üslup peşinde koşmanın nedeni de baştan kuşkuludur; en iyi yazılmış makaleler gösterişsiz, sohbet eder gibi okunur. Dış baskı olduğunu anlıyorum, ama yazarın temel cümleleri LLM cümlelerinden daha iyi olacak gibi
Bu tür makalelerde uzun ve basmakalıp bölümler çok olduğundan, metnin %90'ını yapay zeka yazmış, gerçekten yeni içerik ve önemine dair açıklamayı ise insan yazmış olabilir
Belki de fiilen böyle bir yöntem yaygınlaşıyor olabilir
Bazıları yazı sanatçısı olabilir, ama çoğu değildir
Tespit aracının, 2022 sonrasında literatürde artan sözcükleri ve teknik terimleri yapay zeka özelliği olarak öğrenmiş olması mümkün
Örneğin LLM'ler ve onları kullananlar LLM'lerle sık çalıştığından “large language model” ifadesinin kendisi yapay zekâya benzer diye sınıflandırılabilir. Bu ifade 2022 öncesinde nadirdi; şimdi ve yapay zeka üretimi metinlerde çok geçiyor, ancak günümüz insan yazılarıyla yapay zeka yazılarını ayırt etmek için iyi bir özellik değil. 2023 sonrasında bile LLM üretimi metinlerin neredeyse hiç olmadığını makul biçimde varsayabileceğimiz bir kontrol grubunda arXiv'e kıyasla çok daha düşük tespit oranı görülmeli. Nature ve Science da tamamen muaf olmayacaktır, ancak 2026'ya kadar incelenirse arXiv'den çok daha düşük bir artış eğrisi çıkmalı
Tespit aracını güncellerken bunu azaltmanın yollarına bakacağım, ancak 2023 sonrası temiz bir veri kümesi elde etmek zor. Başka bir yapay zeka tespit aracıyla oluşturulursa, sonuçta o tespit aracından daha iyi olamaz
Mutabakat protokolleri vb. üzerine çalışan birkaç araştırmacıya makale yazmayı mı araştırmayı mı tercih ettiklerini sordum; neredeyse hepsi araştırmanın kendisini seçti
Yazmayı daha çok sevselerdi muhtemelen başka bir meslek seçerlerdi. LLM araştırma grafiklerini, kodları vb. makaleye veya taslağa dönüştürürse kaliteli araştırma makaleleri aksine artabilir. Çünkü “araştırma yapmak istiyorum ama makale yazmak zahmetli” sürtünmesi azalır. Araştırma yetkinliği ve yazmaktan hoşlanmama iki eksen olarak düşünülürse, iki değeri de yüksek olan araştırmacıların çıktılarını LLM ortaya çıkarabilir. Kötü makaleler de artacaktır, ancak uzun vadede net etkinin olumlu olma olasılığı var