1 puan yazan GN⁺ 15 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • 12.750 arXiv makalesinin tüm metni analiz edildiğinde, güncel makalelerin yaklaşık üçte birinin makine tarafından yazılmış gibi okunduğu ve son tamamlanmış çeyrekte saptama oranının yaklaşık %32 olduğu görüldü
  • 2021~2022 makaleleri insan yazımı kontrol grubu olarak alınıp eşik %0,4 yanlış pozitif oranına göre ayarlandı; sürüm 1 PDF’leri ve bootstrap yöntemiyle %95 güven aralıkları kullanıldı
  • ChatGPT’nin ortaya çıkışından sonra saptama oranı iki kez yükselerek 2026 başında yaklaşık %39 ile zirve yaptı; Temmuz 2026’ya kadar son 12 ay bazında bilgisayar bilimleri %65,0, matematik ise %0,7 oldu
  • Çok sayıda formül ile teorem–ispat yapısı içeren matematik makaleleri, dedektörün eğitim dağılımından farklı olduğu için düşük ölçülebilir; gerçek yazarların kullandığı kapalı model–prompt kombinasyonları üzerindeki performans da değerlendirilemiyor
  • Saptama sonuçları yazarı veya yapay zeka üretimi oranını belirleyemez ve hafif düzenleme ile tamamen üretimi ayırt edemez; bu nedenle kişileri suçlamak için değil, makinevari üslup oranının alt sınırı olarak yorumlanmalıdır

Yanlış pozitif oranını temel alan ölçüm tasarımı

  • “İçeriğin %N’i yapay zeka” gibi bir sayı, dedektörün gerçek insan belgelerini de aynı şekilde işaretleme oranı görülmeden çok değerli değildir
    • Yeni makalelerin %40’ını makine yazımı olarak işaretlerken ChatGPT öncesi makalelerin %20’sinde de aynı sonuç çıkıyorsa, önce açıklanması gereken sayı %20 yanlış pozitif oranıdır
  • Dedektör akademik üsluba göre kalibre edildi
    • %0,4 yanlış pozitif oranında, LLM öncesindeki gerçek bilimsel belgelerin %99,6’sını normal şekilde geçirir
    • Yapay zekanın yazdığı akademik belgelerin %85’ini saptar
  • 2021~2022’de gönderilen makaleler insan yazımı doğru veri olarak kabul edildi ve eşik, tam olarak yalnızca %0,4’ü işaretlenecek şekilde ayarlandı
  • Tüm sonuçlar, tasarım gereği LLM öncesi belgelerde %0,4’te kalan eşiği aşan makalelerin oranıdır
  • ChatGPT öncesi yıllar yerleşik kontrol grubu işlevi görür
    • Artış, dedektörün kendisinden kaynaklanan yapay bir sonuç olsaydı 2021~2022 de 2026 kadar yüksek çıkmalıydı; gerçekte böyle olmadı

Örneklem ve analiz yöntemi

  • 10 alan grubunda Ocak 2023’ten Temmuz 2026’ya kadar alan ve ay bazında yaklaşık 25 makale örneklendi; 2021~2022’den 8 aylık kontrol grubu eklenerek toplam 12.750 makale analiz edildi
  • 2026’da revize edilen ifadelerin ilgili makalenin 2023 örneklemine karışmaması için her makalenin sürüm 1 PDF’i kullanıldı
  • Özet yerine tüm metin analiz edildi
    • Aynı makalede özet kısmında %20’nin altında, gövde metninde %70’in üzerinde çıkan örnekler olduğundan yalnızca özeti analiz etmek sinyali zayıflatabilir
  • Tüm sayılara bootstrap yöntemiyle %95 güven aralığı uygulandı

Genel eğilim ve alanlar arası farklar

  • Saptama oranı 2021~2022 boyunca %0,4’te kaldı, ChatGPT’nin ortaya çıkışından sonraki birkaç ay içinde yükselmeye başladı
  • Ardından iki kez artarak son tamamlanmış çeyrekte yaklaşık %32 kaydetti; 2026 başında yaklaşık %39 ile zirve yaptı
  • Temmuz 2026’ya kadar son 12 ayın alan bazlı sonuçları şöyle
Alan LLM öncesi kontrol grubu Güncel saptama oranı %95 güven aralığı
Bilgisayar bilimleri %0,2 %65,0 %59,3~70,3
Nicel biyoloji %3,5 %56,3 %51,0~61,7
Elektrik mühendisliği ve sistemler %1,7 %51,3 %46,0~57,0
Ekonomi ve finans %2,5 %47,0 %41,3~52,7
Uygulamalı fizik %1,3 %34,0 %29,0~39,7
İstatistik %1,8 %31,3 %26,0~36,7
Yoğun madde fiziği %0,0 %24,0 %19,3~29,0
Yüksek enerji fiziği %0,5 %14,0 %10,0~18,0
Astrofizik %0,0 %10,7 %7,3~14,3
Matematik %0,0 %0,7 %0,0~1,7
  • Bilgisayar bilimleri yaklaşık %65 ile en yüksek, matematik yaklaşık %0,7 ile en düşük; ancak matematiğin düşük değerini yorumlamak zor
  • Kontrol grubu sütunu, her alanın 2021~2022 saptama oranlarının üç duyarlılık ayarı üzerinden alınan ortalamasıdır
  • Artışın büyük olduğu alanlarla LLM öncesi kontrol grubu seviyesi yüksek olan alanlar örtüşmediğinden, sonraki yükseliş yalnızca yüksek başlangıç noktasıyla açıklanamaz

Alan bazlı kontrol gruplarının istatistiksel sınırları

  • Her alan için ChatGPT öncesi kontrol grubu 200 makaledir
  • %0,4 yanlış pozitif oranında 10 alandaki 2.000 kontrol makalesi içinde yalnızca 8 makale işaretlendiği için tek bir eşiğe dayalı alan bazlı oranlar kabaca ölçülür
  • Birleştirilmiş toplamda yanlış pozitif alt sınırı yeterince tahmin edildi ve araştırma tasarımı da bunu temel alıyor; ancak alan bazlı kontrol grubu sayıları yalnızca yaklaşık değerlerdir
  • Alan bazında %1’in altındaki oranları hassas biçimde sabitlemek için her alanda binlerce kontrol makalesi gerekir; ancak 2023 öncesi arXiv’de bunu karşılayacak sayıda makale yoktur

Düşük puanlar ve dedektörün kör noktaları

  • Düşük puan, yapay zeka benimseme oranının düşük olduğu anlamına gelebilir ya da dedektörün kör noktalarını yansıtıyor olabilir
  • Matematik makaleleri formüller ve teorem–ispat yapıları üzerine kuruludur; formüller ve kaynakçalar çıkarıldığında geriye az miktarda düzyazı kalır ve bu da dedektörün eğitildiği bilimsel İngilizceden farklıdır
    • Modelden yoğun yardım alınarak yazılmış matematik makaleleri bile düzyazısı dedektörün dağılımı dışında kaldığı için düşük puan alabilir
    • Bu nedenle yalnızca matematik sonuçlarına bakarak düşük benimseme ile düşük saptama duyarlılığını ayırt etmek zordur
  • Düzyazı oranı yüksek olup dedektörün eğitim dağılımına en iyi uyan alanlarda en büyük artış görüldüğünden, bu karıştırıcı etken tek başına genel yükseliş eğilimini açıklayamaz
  • Düşük puanlı alanların sıralaması, yapay zeka benimseme oranının alt sınırı olarak okunmalıdır
  • Dedektörün duyarlılığı üretici modele göre değişir; yazarların gerçekte kullandığı kapalı modellerin ve prompt’ların tam kombinasyonu değerlendirilemez
  • Eksik saptama kapsamı saptama oranını düşürdüğü için ölçülen oran, gerçek makinevari üslup oranının alt sınırıdır; üreticiye göre performans dedektör açıklamasında görülebilir

Saptama sonuçlarının söyleyemediği şeyler

  • Dedektör, bilinen hata oranları ve kalibre edilmiş olasılıklar temelinde bir belgenin makine yazımı gibi okunup okunmadığını tahmin eder
  • Hafifçe düzenlenmiş belgelerle tamamen üretilmiş belgeleri ayırt edemez; tek bir puan belirli bir kişiyi suçlamak için dayanak olamaz
  • Ölçülen şey yazar kimliği veya üretim oranı değil, yapay zekadan yoğun yararlanılmış düzenlemeleri de kapsayan makinevari üslup oranıdır
  • arXiv makaleleri ücretsiz kontrol sayfasında, genel metinler metin kontrol sayfasında kontrol edilebilir; dedektörün işletilmesinden gelir elde edilmiyor

1 yorum

 
Hacker News görüşleri
  • 2011'de yazdığım PyHPC atölye makalesi %27 makine tarafından yazılmış, 2012'deki doktora tezim ise eşik değer olan %42'nin hemen altında, %40 olarak sınıflandırıldı.
    Artık makale yayımlamıyorum ama benim LLM gibi mi yazdığımı, yoksa LLM'in benim yazılarımdan mı öğrendiğini bilmiyorum. 2015 IEEE CLUSTERS makalesi ise tam %74 çıktı.

    • İlk dönem dedektörler Amerikan Bağımsızlık Bildirgesi için bile %100 AI tarafından yazılmış olasılığı veriyordu; yani bu araçlar düzgün çalışmıyor.
      Daha tehlikelisi, nasıl çalıştığını bilmeyen insanların bunlara dayanarak AI kullanıldığını kesin kabul edip öğrencilere ciddi zarar vermesi; bu zaten eğitimin her kademesinde yaşanıyor.
    • “AI tarafından üretilmiş içerikleri ya da deepfake'leri tespit etmeye çalışmanın temel bir kusuru var. Çünkü tespit sonuçlarıyla daha iyi sahte veri üreteçleri eğitilebilir. Sonunda dijital alanda hiçbir şeyin gerçek olduğundan emin olunamayan bir dijital belirsizlik denge durumuna ulaşırız. Dijital bir çıktının insandan mı AI'dan mı geldiği önemli değil; benim için yararlı olup olmadığı önemli. Yararlı içerik konuya odaklanır, gerçeklerle uyumludur ve mümkünse yeni bir şey öğretecek kadar şaşırtıcı olmalıdır.” - https://seanpedersen.github.io/posts/digital-uncertainty/
    • O makalelerin gerçekten eğitim veri kümesine girmiş olma ihtimali de yok mu?
    • Eserleri öğrendikten sonra bir de distillation yapıldıysa yanlış pozitif gürültüsü kaçınılmaz olarak saçma derecede büyük olur.
  • 2021-2026 arasındaki 12.750 arXiv makalesinin tam metni analiz edilerek makine tarafından yazılmış olarak sınıflandırılan oran ve ChatGPT'nin çıkışından sonraki artış incelendi.
    Yanlış pozitiflerden kaçınmak için dedektör bilinçli olarak ayarlanmış; ChatGPT öncesi tespit oranı yaklaşık %0,4 olmuş. Ocak 2026'da tüm makalelerin yaklaşık %39'u, bilgisayar bilimlerinde ise en fazla %65'i AI tarafından yazılmış olarak sınıflandırılmış; matematik %0,7'den neredeyse kıpırdamamış, ancak ispat odaklı üslubu düzgün yakalayamamış olabilir. Bu yalnızca istatistiksel bir sinyal tahminidir, belirli bir yazarın AI kullandığının kanıtı değildir; makine yazımı güçlü AI destekli düzenlemeyi de kapsayabilir.

    • Hangi dedektörün kullanıldığını ve ticari AI dedektörlerinin hepsinin çürütüldüğü bir ortamda doğruluktan nasıl emin olunabildiğini merak ediyorum.
    • Zaman serisi sonuçları oldukça ikna edici görünüyor ama dedektörün eğitim yönteminin bu analizden bağımsız olup olmadığını merak ediyorum.
      ChatGPT öncesi belgelerin pozitif eğitim verisine dahil edilmesi gibi bir sızıntı olabilir.
    • LLM öncesi belgelerde çıkan yanlış pozitif örnekleri paylaşılırsa dedektörü neyin tetiklediğini anlayabiliriz.
      LLM'ler ortaya çıkmadan önce de çok az sayıda yazarın LLM gibi yazıp yazmadığını merak ediyorum.
    • 2020 öncesi makalelere kadar genişletilirse tespit sisteminin baz doğruluğu daha iyi anlaşılabilir.
    • Modelin yerelde çalıştırılıp çalıştırılamayacağını ya da tüm arXiv ön baskı makaleleri için sonuç tablosu sağlanıp sağlanamayacağını merak ediyorum.
      Çok sayıda makaleyi kontrol ederken sunucuya aşırı yük bindirmek istemem.
  • Şirketlerde LLM kullanımında gerçekten oyun teorisi temelli teşvikler işliyor.
    Geliştiriciler Claude Code'u her yerde kullanıp görünürde daha iyi kod ve dokümantasyonu bolca üretiyor, yönetim de kısa vadede olumsuz taraf görmediği için bunu teşvik ediyor. Yapısal kalite belirsiz, ama yanlış metriklerle yalnızca üretim miktarı göründüğünden, bilişsel yeteneklerin körelmesini göze almaya değip değmediğini anlamak yıllar sürecek. Bütün gün LLM kullanmayan biri üretim miktarında geride kalmaya mahkûm; yayın sayısının önemsendiği bilim dünyasında da aynı baskının işlemesi çok olası.

    • Temel biyomedikal araştırmalarda LLM'ler ham ıslak laboratuvar deney verilerini çoğunlukla yorumlayamadığı için genelde görmezden geliniyor.
      Buna rağmen çok sayıda startup ve yeni yardımcı doçent “AI” ile yeni alanlar açtığını öne sürüyor; gerçekte ise en etkili yaklaşım LLM'den çok makine öğrenmesi kullanıyor.
    • ChatGPT-5.6 Sol'un yardımıyla 2.800 satırlık Python tabanlı Rhino3D geometrisini Python tabanlı OCCT/FreeCAD'e taşıyorum; işin yarısına geldiğimde kod 36.000 satıra çıkmıştı.
      Yinelenmeyi en aza indirme ve kodu küçültme hedefiyle sürekli talimat verdim ama sonuç daha çok “berbat olsa da benim için işe yarıyor” seviyesinde. Bu kadar faydayı bile göz ardı edemem; fakat taşan bir tuvalete bakıp değerin maksimize edildiğini sanan yönetim beni korkutuyor.
    • LLM kodu beceriksiz bir geliştiricinin kodundan iyi, istekli ortalama bir geliştiricinin kodundan kötü; ama genel olarak yeterince kullanılabilir.
      Asıl zor soru harcanan zaman ve maliyete karşı kalite; şu an abonelik ücreti bazında opus/fable tarafından üretilen kodun yeterince avantajlı olduğunu düşünüyorum.
    • Fiyat artışından önce yönetimin kullanımı koşulsuz dayatacağından çok endişeliydim; şimdi ise AI'ın çok pahalı hale gelip büyük şirketlerde ek benimsemeyi gerekçelendirememesini umuyorum.
      Yeni aracın kendisi iyi, ama yönetim metriklerini tutturmak için belirli bir aracı kullanmaya zorlanmaktan hoşlanmıyorum.
    • Bilişsel yeteneklerin körelmesi başlı başına amaç da olabilir.
      İnsanlar AI'a bağımlı hale geldiğinde şirketler yasaları kendi lehlerine değiştirecek nüfuzu elde eder. Vatandaşlar şehir merkezindeki dev veri merkezlerine karşı çıksa bile, şirketler o veri merkezlerinin sağladığı AI olmadan hiçbir şey yapamayacaklarını söyleyerek baskı kurabilir; bu yüzden insanları yetersiz ve bağımlı hale getirmek kilit nokta olabilir.
  • Yalnızca metin kullanan tüm AI tespit yöntemlerinde olduğu gibi doğruluk endişe verici.
    Özellikle üç dedektör puanını en sonda birleştirme sürecinin önyargı yaratmadığından nasıl emin olunduğunu bilmiyorum; kaynak kodu olmadığı için nasıl çalıştığını incelemek ya da araştırmayı yeniden üretmek de zor. LLM öncesinde bizzat yazdığım yayımlanmamış bir çalışma da yüksek puan aldı; başka bir makalede neredeyse her cümle kırmızı “machine-leaning” olarak işaretlenmesine rağmen puanı etkilemedi. Aynı metnin puanı LaTeX biçimlendirmesi olup olmamasına göre de ciddi biçimde değişti. Sonuç şu olmalı: “Üretilmiş metni tespit etmek zordur; sadece hipotezi doğruluyor diye sonuçlar kabul edilmemelidir.” Bu yazıyı da az önce kendim yazdım ama makine yazımı puanı yüksek çıkıyor.

    • En endişe verici kullanım, okullarda kopya çeken öğrencileri yakalamak için bu tür araçların kullanılması.
  • Akademik ortamda aynı soruna bakıldığında, yalnızca metinden yapay zeka yazımını güvenilir biçimde tespit etmenin imkânsız olduğu sonucuna varılmış
    Bir insan ve bir LLM tesadüfen tamamen aynı paragrafı yazdıysa, tek bir girdiyi sentetik ve insan yazımı diye ayırmanın yolu yoktur. Gerçekte LLM'lere özgü izler vardır, ancak bunlar zamana ve modele göre değiştiği için sentetik gibi görünen insan yazılarıyla insan gibi görünen sentetik yazıları ayırt etmek mümkün değildir. Daha ilginç yaklaşım, deneme derlemlerinde sözcük dağarcığının, dilsel özelliklerin, üslup gömmelerinin, genel gömmelerin, yazım hatalarının, hataların ve kaynakçaların LLM'lerin devreye girmesinden sonra nasıl değiştiğini analiz etmektir. Topluluk düzeyinde akademik üslubun değiştiği açık, ancak nedenini izlemek zor

    • Çok kısa ifadeler dışında olası anlatımlar hızla kombinatoryal patlamaya yol açtığından, sonlu kombinasyonlar yüzünden kusursuz sınıflandırmanın imkânsız olduğu açıklamasına katılmıyorum
      Chomsky'nin dediği gibi, bir insanın söylediği ya da anladığı neredeyse her cümle, evren tarihinde ilk kez ortaya çıkan bir sözcük birleşimidir. Daha büyük zorluk, LLM'lerin tek bir sabit ifade üretmemesi ve metnin bilgi yoğunluğunun düşük olması nedeniyle dar güven aralıklarıyla istatistiksel test yapmak için kayda değer miktarda metne ihtiyaç duyulmasıdır
  • Okunan makalelerin %65'i yapay zeka yazımı özellikleri gösteriyorsa, doğrudan yapay zeka kullanılmasa bile yapay zeka üslubunun etkisi altında kalınır
    Bu etkinin, özellikle üslubu hâlâ oluşmakta olan yeni araştırmacılarda daha güçlü görülme olasılığı yüksektir

    • Yapay zeka üslubunun etkisi belirli sözcükler veya retorik ifadeler gibi kısmi biçimde ortaya çıkacaktır, ancak yapay zeka üretimi metinler genellikle çıktının tamamında tutarlı biçimde yapay zeka gibi duyulur
      Bir insanın yapay zekanın sözdizim kalıplarını uzun süre koruyabilmesi için, şu anda kimsenin tam olarak bilmesi zor olan kalıpları kavraması ve her yan cümleyi bir tablo sahteciliği gibi ince ince ayarlaması gerekir. Ayrıca yapay zeka üslubu da değişiyor; tipik işaretlerden biri olan delve, 2024 ortasından sonra keskin biçimde azaldı ve artık LLM çıktılarında neredeyse yok oldu. Bunu öğrenip izleyen insanların yazıları, aksine güncel yapay zeka üslubuna daha az benzer hâle gelir
    • O %20'nin anlamı, tespit araçlarının sanıldığı kadar güvenilir olmaması ya da yapay zekanın insan yazılarını öğrenmesi nedeniyle mevcut insan üslubunun bazı bölümlerinin artık yapay zeka laf kalabalığı özelliği hâline gelmesi olabilir
      Yapay zekadan önce de laf kalabalığı üreten insanlar vardı
  • Ana dili İngilizce olmayan biri olarak, makalelerin çoğunun yapay zeka tespit araçlarına takılması şaşırtıcı değil
    Bunun nedeni LLM'den makalenin tamamını yazmasını istemek değil; bilimsel üsluba alışık olmamak ve Amerikalı editörlerin bunu talep etmesidir. Fikirleri temel cümlelerle yazıp LLM ile akıcı hâle getirebilirsiniz. Her paragrafı kendiniz yazdıktan sonra daha bilimsel biçimde cilalarsanız, içerik bütünüyle size ait olsa bile LLM üretimi diye sınıflandırılır. Tersine, İngilizceyi yeterince iyi cilalarsanız LLM'nin yazdığı bir makale de insan yazısı gibi görünebilir

    • Tam da beklediğim kullanım biçimi bu ve yanlış olduğunu düşünmek için bir neden yok
    • İngilizce yeterliliğimde sorun yok ve yüksek lisans tezimi de İngilizce olarak kendim yazdım, ancak bilimsel üslupla yazmak çok zahmetli
      Yeniden makale yazacak olsam her şeyi elle yazmayı düşünmem; içeriğin niyetimle uyuştuğunu doğrular ve yanlış yazılmış yerleri düzeltirsem sorun yok. Ana dili İngilizce olanların yazdığı makaleler arasında da LLM ile yeniden yazılsa çok daha iyi olacak çok sayıda metin var
    • Bu yanlış bir davranıştır
    • “Daha bilimsel” hâle getirmek, asıl anlamı sadık biçimde koruyan basit bir üslup düzeltmesi değildir
      Her paragraftaki ayrıntılı ifadeler neyin nasıl aktarıldığı üzerinde büyük etkiye sahiptir; bu yüzden bütünüyle kişinin kendi makalesi saymak zordur. Zaten bilimsel görünen bir üslup peşinde koşmanın nedeni de baştan kuşkuludur; en iyi yazılmış makaleler gösterişsiz, sohbet eder gibi okunur. Dış baskı olduğunu anlıyorum, ama yazarın temel cümleleri LLM cümlelerinden daha iyi olacak gibi
    • LLM ile dilbilgisi ve yazım düzeltmek ile metin üretmek arasında ince bir sınır vardır
  • Bu tür makalelerde uzun ve basmakalıp bölümler çok olduğundan, metnin %90'ını yapay zeka yazmış, gerçekten yeni içerik ve önemine dair açıklamayı ise insan yazmış olabilir
    Belki de fiilen böyle bir yöntem yaygınlaşıyor olabilir

    • Makalenin %90'ı basmakalıp ifadelerden oluşuyorsa, önce bunun akademik makale olarak yayımlanmaya değer bir içerik olup olmadığını sormak gerekir
    • Bilimsel faaliyette yazı yazmak çoğunlukla boşa harcanan zamandır; makine bunu ustaca yapabiliyorsa araştırmacının bizzat yazması için az neden vardır
      Bazıları yazı sanatçısı olabilir, ama çoğu değildir
  • Tespit aracının, 2022 sonrasında literatürde artan sözcükleri ve teknik terimleri yapay zeka özelliği olarak öğrenmiş olması mümkün
    Örneğin LLM'ler ve onları kullananlar LLM'lerle sık çalıştığından “large language model” ifadesinin kendisi yapay zekâya benzer diye sınıflandırılabilir. Bu ifade 2022 öncesinde nadirdi; şimdi ve yapay zeka üretimi metinlerde çok geçiyor, ancak günümüz insan yazılarıyla yapay zeka yazılarını ayırt etmek için iyi bir özellik değil. 2023 sonrasında bile LLM üretimi metinlerin neredeyse hiç olmadığını makul biçimde varsayabileceğimiz bir kontrol grubunda arXiv'e kıyasla çok daha düşük tespit oranı görülmeli. Nature ve Science da tamamen muaf olmayacaktır, ancak 2026'ya kadar incelenirse arXiv'den çok daha düşük bir artış eğrisi çıkmalı

    • Geçerli bir olasılık, ancak sezgisel olarak asıl tespit makalesinin yalnızca küçük bir kısmını açıklıyor gibi
      Tespit aracını güncellerken bunu azaltmanın yollarına bakacağım, ancak 2023 sonrası temiz bir veri kümesi elde etmek zor. Başka bir yapay zeka tespit aracıyla oluşturulursa, sonuçta o tespit aracından daha iyi olamaz
  • Mutabakat protokolleri vb. üzerine çalışan birkaç araştırmacıya makale yazmayı mı araştırmayı mı tercih ettiklerini sordum; neredeyse hepsi araştırmanın kendisini seçti
    Yazmayı daha çok sevselerdi muhtemelen başka bir meslek seçerlerdi. LLM araştırma grafiklerini, kodları vb. makaleye veya taslağa dönüştürürse kaliteli araştırma makaleleri aksine artabilir. Çünkü “araştırma yapmak istiyorum ama makale yazmak zahmetli” sürtünmesi azalır. Araştırma yetkinliği ve yazmaktan hoşlanmama iki eksen olarak düşünülürse, iki değeri de yüksek olan araştırmacıların çıktılarını LLM ortaya çıkarabilir. Kötü makaleler de artacaktır, ancak uzun vadede net etkinin olumlu olma olasılığı var