- NeurIPS, WACV ve ECCV TerraBytes kapsamında incelenen 22 makalenin 15’inde (%68) uydurulmuş atıflar ve yazar listeleri ya da açıkça LLM tarafından üretilmiş cümleler vardı; sahte yazarları bildiren iki makale de kaynakçanın düzeltilmesi şartıyla sözlü sunum olarak kabul edildi
- 2025 akademik literatüründe yaklaşık 146.900 halüsinasyon atıf bulunduğu tahmin ediliyor; bioRxiv’den yayımlanmış sürümlere kadar izlenen halüsinasyon atıfların %85,3’ü hakemlikten geçtikten sonra da kaldı
- Sorun başvuruların ötesine hakemliğe de yayıldı: ICLR 2026 değerlendirmelerinin %21’i tamamen yapay zeka üretimi olarak sınıflandırıldı; ICML 2026’da ise LLM kullanması yasak olan hakemlerin yazdığı yaklaşık 795 değerlendirmede LLM kullanımı tespit edildi
- Sorun LLM kullanımının kendisinden çok doğrulanmamış sonuçların sunulması; kaynakça hataları, metin ile tablolardaki sayısal değerlerin uyuşmaması, sonuçların aşırı pazarlanması ve yalnızca metrikleri tekrar eden tartışma bölümleri, taslağın yeterince incelenmediğinin işareti
- Kaynakçaları birden çok kayıt kurumu ile karşılaştıran
bib-audityayımlandı; ancak gizli başvuruların bazı kısımlarını barındırılan bir LLM’e gönderdiği için hakemlerin önce ilgili konferansın gizlilik ve LLM politikalarını kontrol etmesi gerekiyor
22 makaleyi incelerken görülen ölçek
- İki hakem yaz boyunca NeurIPS, WACV ve ECCV’nin jeo-uzamsal çalıştayı TerraBytes kapsamında toplam 22 makale inceledi
- 15 makalede (%68) tamamen uydurulmuş atıflar, gerçek makalelerin değiştirilmiş yazar listeleri, halüsinasyon ürünü terimler, anlamsız cümleler ve ilgisiz atıflar gibi açık LLM üretimi izleri bulundu
- Hakemlerden biri 11 makalenin 6’sında (%55), diğeri 11 makalenin 9’unda (%82) bu sorunları tespit etti
- Konferans bazındaki sonuçlar şöyleydi
- NeurIPS Datasets and Benchmarks bölümü: 5 makalenin 2’si
- NeurIPS Position Paper bölümü: 2 makalenin 2’si
- TerraBytes: sırasıyla 2 makalenin 1’i, 5 makalenin 4’ü
- WACV: iki hakemin de 4 makalenin 3’ü
- Yalnızca atıf sorunları nedeniyle desk reject edilebilecek makale sayısı sırasıyla 5 ve 9’du
- İki WACV makalesi, kaynakçanın ilk maddesinden itibaren gerçek makalenin yazarlarını sahte adlarla değiştirmişti
- Bir NeurIPS makalesinde 53 sayfa boyunca halüsinasyon ürünü veya anlamsız terimler bulunduğundan kaynakça incelemesinin kendisi anlamsız hale gelmişti
- İki NeurIPS Position Paper’ın ikisi de LLM üretimi olarak değerlendirildi; TerraBytes için atanan 5 makalenin 4’ünde de sahte atıflar veya yazarlar vardı
Akademik literatür geneline yayılan halüsinasyon atıflar
- Nisan 2026 tarihli Nature analizi, 2025 yayınlarından en az on binlercesinde hatalı, yapay zeka üretimi kaynakçalar bulunmuş olabileceğini ortaya koydu
- Zhao ve arkadaşlarının arXiv, bioRxiv, SSRN ve PubMed Central denetimi, yalnızca 2025’te yaklaşık 146.900 halüsinasyon atıf olduğunu tahmin etti
- Bunlar az sayıda kötü niyetli aktörde yoğunlaşmamış, çok sayıda makaleye ince bir şekilde yayılmıştı
- Kariyerinin başındaki araştırmacılar ve küçük ekiplerde bulunma olasılığı en yüksekti
- Halüsinasyon atıf içeren bioRxiv preprint’lerinin yayımlanmış sürümleri izlendiğinde %85,3’ünün aynen kaldığı görüldü
- The Lancet’in 2,5 milyon biyomedikal makale denetiminde, en az bir sahte kaynakça maddesi bulunan makalelerin oranı iki yılda 6 kat arttı
- 2023’te 2.828 makalede 1 iken 2025’te 458 makalede 1’e çıktı
- 2026 başında 277 makalede 1’e ulaştı
- NeurIPS 2025’te yayımlanan makalelerdeki 100 halüsinasyon atıf analizinde, tüm atıfların 3 ila 5 uzman hakemin incelemesinden geçtiği görüldü
- Bu atıfları içeren makale sayısı 53’tü; bu da tüm kabul edilenlerin yaklaşık %1’iydi ve halen proceedings içinde yer alıyorlar
Yapay zekanın yazdığı akran değerlendirmesi ve manipülasyon olasılığı
- Pangram’ın ICLR 2026 analizi, 15.899 değerlendirmenin, yani %21’inin tamamen yapay zeka tarafından üretildiği sonucuna vardı
- Tüm değerlendirmelerin yarısından fazlasında bir şekilde yapay zeka yer almıştı
- Organization Science, ChatGPT’nin ortaya çıkmasından sonra başvuruların %42 arttığını ve mevcut akran değerlendirmelerinin %30’dan fazlasında belli düzeyde yapay zeka kullanıldığını ölçtü
- ICML 2026’daki prompt injection tespiti, LLM kullanması yasak olan Policy A hakemlerinden 506 kişinin yazdığı yaklaşık 795 değerlendirmede LLM kullanımı buldu
- Bu, tüm değerlendirmelerin yaklaşık %1’ine karşılık geliyor
- NeurIPS’te de açıkça yapay zeka üretimi etik değerlendirmeleri ve birden fazla yapay zeka üretimi rebuttal gözlemlendi
- Yapay zeka değerlendirmeleri, makalenin bilimsel içeriğini değiştirmeden özeti hasmane biçimde yeniden yazarak puanı yükseltebilir
- Li ve arkadaşlarının deneyinde en güçlü saldırı yaklaşık %38 başarı oranına ulaştı
- 10 puanlık ölçekte Gemini 3 Flash hakeminin kabul puanı 1,31 puan, GPT 5.4 Mini hakeminin puanı 0,88 puan arttı
- Saldırganın hangi değerlendirme modelinin kullanıldığını bilmesine de gerek yoktu
Gerçek hakemlikte bulunan manipülasyonlar ve ayırt etme sinyalleri
- En kötü örnekler, gerçek makalelerin konferansını, başlığını ve diğer yazarlarını koruyup yalnızca kişisel olarak tanınan yazarları benzer hayali adlarla değiştiren iki başvuruydu
- Hakem reddi önerip düzenleyicilere doğrudan bildirmesine rağmen iki makale de kaynakça düzeltme şartlı sözlü sunum olarak kabul edildi
- SatMAE’ye atıf yapan WACV makalesi yazarları “Yuyang Cong, Saurabh Khanna, Chen Meng, et al.” diye yazdı
- Gerçek yazar listesi Yezhen Cong, Samar Khanna, Chenlin Meng ile başlıyor
- 53 ve 40 sayfalık NeurIPS makalelerinde halüsinasyon ürünü terimler ve uydurulmuş kaynakçalar vardı; bir makale bazı atıfların yanına LLM iç notları bile bırakmıştı
- Sahte yazarlar ve tamamen sahte kaynakça maddeleri, taslağın yeterince incelenmediğini ortaya koyuyor
- İlgili araştırmanın gerçekten okunup okunmadığı, doğru bağlamda atıf yapılıp yapılmadığı ve makalenin, kodun, veri setinin diğer kısımlarına güvenilip güvenilemeyeceği belirsizleşiyor
- Halüsinasyon kaynakçası olan makalelerin kabule hazır olmadığı ve desk reject edilmesi gerektiği savunuluyor
-
LLM tarafından yazılmış olma olasılığı yüksek sinyaller
- Yaygın üslup sinyalleri arasında “It’s not X, it’s Y”, “The real X is Y” gibi karşıtlık kalıpları, aşırı kalın yazı ve em dash, yorumlanması zor yoğun cümleler ve sonuçların aşırı pazarlanması yer alıyor
- Daha incelikli bir sinyal, metindeki sayılar veya metriklerin tablolarla uyuşmaması
- Deneyler yeniden çalıştırıldıktan sonra ajana tüm sayıları güncellemesi veya doğrulaması söylenmezse bu tür uyuşmazlıklar oluşuyor
- Claude, ekte veya kodda olması gereken sayıları bile metne sıkıştırma ve tartışma bölümünde tablodaki metrikleri aynen tekrar etme eğiliminde
- Ortalama ve standart sapma olmadan %1’in altındaki iyileşmeyi SOTA diye adlandıran özel modeller, atıfın yeterli olduğu yerde kullanılan karmaşık formüller ve ekte olması gereken ablation deneyleri de uyarı sinyalleri
Hakemlik işinde ortaya çıkan değişim
- Özet okunduktan hemen sonra önce kaynakçaya göz atma ve tüm makalenin LLM çıktısı olup olmadığını hızlıca kontrol etme şeklinde hakemlik süreci değişti
- LLM izlerini aramak daha fazla zaman aldıkça makalelerin iyi niyetle sunulduğu varsayımı da zayıflıyor
- İlginç, insan tarafından yazılmış ve okunmaya değer makalelerin sayısının ciddi ölçüde azaldığı hissediliyor
- Ancak halüsinasyon kaynakçaları hariç tutunca, mevcut düşük kaliteli insan yazımı makaleleri incelerken görülen sorunlara benzer pek çok sorun da var
- LLM kullanımı olgusu tek başına bir değerlendirme ölçütü değil
- LLM yazıma yardımcı olmuş olsa bile araştırma ilginç, deneyler geçerli ve yeniden üretilebilir ise sorun yok
- Sorun, incelenmemiş LLM çıktısını olduğu gibi sunup hakemlerden geri bildirim istemek
- Konferansların başvuru sahiplerine 4-5 değerlendirmeyi zorunlu kılması ücretsiz hakemlik yükünü de artırıyor
- Hakemler gece veya hafta sonu zaman ayırarak inceleme yapıyor; atıf halüsinasyonları sonradan fark edilirse bu zaman boşa gidiyor
- Bir araştırmacının değerlendirmelerden öğrenebilmesi için önce kendi çalışmasını yeterince okuyup üzerinde düşünmesi gerekiyor
LLM’i araştırma ve yazımda kullanma biçimi
- Claude gibi LLM’ler her gün kullanılsa da çıktı mutlaka doğrulanıyor, düzenleniyor ve yeniden yazılıyor
- Literatür taraması taslağı için Claude kullanıldıktan sonra özgün makaleler ve gönderiler bizzat okunuyor
- Blogun atıf yaptığı özgün araştırmalar bulunup onların yerine konuyor, materyal yeniden düzenleniyor ve gereksiz ayrıntılar çıkarılıyor
- Makale gönderilmeden önce tüm taslak dikkatle okunuyor ve kaynakça elle kontrol ediliyor
- Claude’dan belirsiz kısımları bulması istenip niyeti anlaması için çoktan seçmeli sorularla görüşme yaptırılıyor
bib-auditçalıştırıldıktan sonra bile Google Scholar, IEEE, CVF gibi veritabanlarında her madde tek tek kontrol ediliyor- Yıllar içinde Zotero’da biriktirilmiş gerçek BibTeX kayıtları da yeniden kullanılıyor
- Erken aşamada başkalarından geri bildirim alınıyor; gerekirse taslak yazılırken metnin tamamı yeniden yapılandırılıyor
- Son dakika acele işlerin düşük kaliteli LLM makaleleri ürettiği düşünülüyor
- LLM öncesinden oluşmuş araştırma sezgisi önemli; genç araştırmacıların yönsüz biçimde araştırma ürettiği bir ortamdan endişe ediliyor
-
Claude’un üslubunu kontrol etme yöntemi
- Ajanın yazdığı cümleler aşırı yoğun ve akışı kötü olduğundan em dash ve noktalı virgül sınırlandırılıyor
- Fable 5, em dash yerine iki noktayı aşırı kullanma ve B2B SaaS pazarlama üslubu üretme eğiliminde
- Ne aşırı saldırgan ne de sönük; alan dışındaki okurların da okuyabileceği cümleler hedefleniyor
- Bilimsel yazım ile ASD-STE100 Simplified Technical English arasındaki kuralları içeren bir skill etkili oldu
- Önce metnin amacı ve okuru belirlenmeli, ardından format okura göre ayarlanmalı
- Claude’un varsayılan üslubu bilimsel okurlar için uygun değil
- Aşırı kalın yazı, madde işaretli listeler ve pazarlama ifadeleri kalırsa içeriğin kaynağı ve doğrulanıp doğrulanmadığı bile sorgulanabilir
Açık bildirim yerine başvuru aşamasında filtreleme neden gerekli
- LLM kullanımı bildirme zorunluluğu iyi niyetli araştırmacılar için yararlı olabilir, ancak gerçek davranışı çok değiştirmesi beklenmiyor
- TorchGeo’ya “LLM kullanılmadı”, “LLM destekli”, “tamamını LLM yazdı” aşamalarından oluşan bir yapay zeka politikası eklendi; ancak son seçeneğin gönüllü olarak seçilme olasılığı düşük
- LLM ile yazılmış olsa bile sonuçları doğrulanmış ve yeniden üretilebilir iyi bir makale ise kabul edilebilir
- Yaygın LLM hatalarını bulup taslağın hakemliğe uygun durumda olup olmadığını belirleyecek bir desk reject mekanizması veya işaretleme aracı gerekli
- Şu anda hakemler fiilen desk reject işini paylaşıyor; bu iyi niyetli hakemler için adil değil
- ICLR, 2027’den itibaren OpenReview’de yazar adlarını açık gösterecek
- Sorumluluk yazarlara, danışmanlara, alan başkanlarına, düzenleyicilere ve konferanslara ait
- Yazarlar CV doldurmak için çok sayıda düşük emekli makale göndermemeli
- Danışmanlar ve mentorlar öğrencilerin düşük emekli başvurularını engellemeli
- Düzenleyiciler büyük başvuru hacmi içinde bunları ayıklamanın yolunu bulmalı
- Yayın teşvikleri sorunu LLM’lerden önce de vardı; Lipton ve Steinhardt 2018’de matematiksel süsleme, dilin kötüye kullanımı ve uyumsuz teşvikleri özetlemişti
- LLM ile ders projeleri veya otomatik araştırma sonuçları NeurIPS formatında makale gibi gösterilebilse de gerçek bir araştırma katkısı değilse gönderilmemeli
- Opus 4.6 ve Karpathy’nin autoresearch deposu kullanılarak LandCoverAI üzerinde SOTA gibi görünen sonuçlar ve bir makale üretilebilmişti; ancak araştırma katkısı olmadığı için gönderilmedi
- AAAI 2027’ye 48.000 özet gönderildi; otomatik filtreleme probleminin ölçeği daha da büyüdü
bib-audit ile kaynakçanın otomatik denetimi
bib-audit, kaynakçadaki başlık, yıl ve tam yazar listesini kayıt kurumu kayıtlarıyla karşılaştıran MIT lisanslı bir Claude Code skill’i.bib,.bblve PDF girdi olarak verilebiliyor.bblve PDF için Claude, render edilmiş kaynakçayı yapılandırılmış alanlara geri dönüştürüyor- Ardından betik her maddeyi Crossref, arXiv, DataCite ve Semantic Scholar üzerinde kontrol ediyor
- Sonuçlar ciddi hatalardan başlayarak sıralanıyor
- Var olmayan makaleler
- Uydurulmuş tanımlayıcılar ve sahte yazarlar
- Gerçek makalelerin hatalı metaverileri, kırpılmış yazar listeleri, preprint ile yayımlanmış sürüm arasındaki yıl farkları
- Sayfa aralıklarında tek tire, URL olarak kaydedilmiş DOI,
J.D.biçiminde baş harfler gibi biçimlendirme hataları
- Yalnızca başlığın var olup olmadığını kontrol etmeyip tam yazar listesini karşılaştırdığı için SatMAE örneğindeki gibi yazar değiştirmelerini bulabiliyor
- DOI veya arXiv ID olmadan yalnızca başlık aramasıyla eşleşen maddeler için kesin hüküm vermiyor; elle kontrol edilmesi gereken öneriler olarak döndürüyor
- Değerlendirmede motivasyon tahmin edilmemeli; “arXiv kaydındaki ilk yazar Yuyang Cong değil, Yezhen Cong” gibi yalnızca gözlemlenen olgular raporlanmalı
.bibkontrolü salt okunur ve ayrı bağımlılık gerektirmiyor; tanımlayıcıyla sabitlenmiş maddelerdeki uyuşmazlıklarda başarısız olacak şekilde ayarlanabildiği için gönderim öncesi CI kapısı olarak kullanılabiliyor- Claude dışında
npx skills add isaaccorley/skillsile Codex, Copilot, Cursor ve diğer ajanlara kurulabiliyor
Hakemlerin kontrol etmesi gereken gizlilik ve konferans politikaları
- Denetim süreci gizli başvurunun kaynakçasından bazı kısımları barındırılan bir LLM’e gönderdiği için, değerlendirme yazmakta LLM kullanılmasa bile konferans politikasını ihlal edebilir
- ECCV 2026 politikası, yerel veya API LLM ile değerlendirme ya da meta değerlendirme yazılmasını yasaklıyor; başvurunun önemli bölümlerinin LLM ile paylaşılması da ayrıca yasak
- WACV hakem yönergeleri, LLM üretimi değerlendirmeleri çok sorumsuz bir davranış olarak tanımlıyor
- İhlal halinde hakemin kendi makalesi desk reject edilebilir
- Gizli materyalin hakem olmayan kişilere gösterilmesi de yasak; barındırılan LLM hakem değildir
- NeurIPS LLM politikası, hakemlerin LLM hizmetleriyle paylaşabileceği içerikleri sınırlandırıyor
- Resmi yapay zeka destekli hakemlik deneyi izin verilen kullanım yoludur
- Yazarlar gönderimden önce
bib-audit’i kendileri çalıştırabilir; ancak hakemler kullanmadan önce mutlaka ilgili konferansın LLM ve gizlilik politikalarını kontrol etmeli
1 yorum
Hacker News yorumları
Şu anda AI araştırma yayın sürecinde makale yazımı, hakemlik, okuma ve özetleme bile AI tarafından yapılıyor
NeurIPS de AI destekli hakemlik deneyi yürütüyor ve büyük konferanslarda o kadar çok makale var ki insanların hepsini okuması imkansız
Akademik yayın sürecinde insanlar çok hızlı biçimde otomasyon tarafından dışarı itiliyor
Son EMNLP değerlendirmelerinde benzer bir şey yaşadım ve AI hâlâ araştırma kalitesini değerlendirecek seviyeden çok uzak
Dürüst akran değerlendirmesi gibi kamusal bir değer suistimal ediliyor, ama hakemlik sistemine erişimi aşırı bir sosyal puan sistemiyle sınırlamak dışında belirgin bir çözüm görünmüyor
Araştırmacıların çoğu AI'ı aktif biçimde kullandığı için bunu cezalandırmak ya da kendilerini de dezavantajlı duruma sokacak bir ortam yaratmak istemiyor; genel hava endişelenmeyin, kabullenin yönünde
Sonunda, en başından beri bilimin kendisini gerçekten ciddiye alan insan sayısının çok az olduğu gibi sert bir gerçek ortaya çıkıyor
Ekonomik hesaplar yüzünden insan sağlığı ve refahı için gereken gerçek bileşenler olmadan, sadece görünüşte benzer ikamelerin sunulduğu alanlar anlamına geliyor
Eğer akademinin genel hali buysa, araştırma fonlarının kesilmesini savunanlara da hak vermeye başlıyorum
Bu, yayın yapmazsan yok olursun sisteminin mantıksal sonucu
Bu sistemi kaldırırsanız sorunun büyük kısmı da ortadan kalkar; yöneticiler basit metrikler istese de araştırmada böyle metrikler yok
Teknik borç kısmı da birebir aynı; sayısız makale var ama çoğu muhtemelen tekrar üretilemez ve hangilerinin öyle olduğunu bilmiyoruz
Yayın ve atıf performansı manipüle edilebilir ama somuttur; çok atıf alan makaleler genelde faydalıdır ve bunun ödülü yazarlara döner
Bunu kaldırıp daha iyi bir alternatif kuramazsak, işler bugünkünden de fazla çevre ve hitabet becerisine bağlı hale gelebilir
AI'ın ürettiği hataları olduğu gibi teslim etmek, intihale yakın bir ihlal sayılmalı ve benzer cezalar uygulanmalı
Açıklama yapıp yapmamak ile aşırı kullanım farklı şeyler, ama halüsinasyonları ve hataları bile kontrol etmediyseniz, asıl sorun AI'dan çok beceriksizlik ve tembellik
arXiv aylık gönderim istatistikleri bence logaritmik ölçeğe çevrilmeli
2027'de akademi Moltbook gibi bir şeye dönüşebilir gibi görünüyor
Düşük kaliteli makaleler gösterişli ve büyük konulara yığılıyor; özellikle makine öğrenimi çok kötü durumda, ama önemli olup da niş kalan ve bu tür yazarların henüz bulaşmadığı konular da var
O alanlar hâlâ ciddi araştırmacılar tarafından sürükleniyor, ama doğrudan çalışmazsanız var olduklarını bilmek zor
Bu, akademinin makaleler ve dergilerin açık erişilebilirliğini ciddiye almamasının bir yan etkisi
Makaleler dergilerin erişim kısıtına takılmasaydı, atıf yapılan makalelerin ve alıntıların gerçekten var olup olmadığını doğrulamak kolay olurdu
Akran değerlendirmesi ödül olmadan sadece itibar kazandırıyor; platform ve yayınevi ise kazancı topluyor; bu, Reddit moderatörlüğüne benziyor
Yapı şöyle: yazar yayın ücretini ödüyor, başka bir yazar da ücretsiz düzeltme yapıyor; bu yüzden akademisyenlerin ön baskıları ya da popüler makaleleri kişisel sitelerine koyması doğal bir tercih
Ancak atfın içeriğinin gerçekten iddiayla uyuşup uyuşmadığını doğrulamak için makaleyi okuyup yorumlamak gerekir; bu yüzden yalnızca açık erişimle iş basitleşmez, AI ile ilk kontrol yapılsa bile çok zahmetli bir iştir
Bir konferansa makale gönderince zorunlu olarak 4-5 makaleye hakemlik yapmak gerektiği gerçekten doğru mu diye merak ediyorum
Bu durumda düzgün makaleler bile kaynağı ve uzmanlığı bilinmeyen insanlara zorla incelettiriliyor demektir
Ben zorunlu olarak 7 makale değerlendirdim; 30 bin makale içinden istediğim 30'una başvurdum ama bir tanesi bile verilmedi, onun yerine yeterli uzmanlığım olmayan 7 makale verildi
Ancak gönderimler artmaya devam ediyor ve gönüllü hakem sayısı yetersiz olduğu için zorunlu hakemlik gerçekten uygulanıyor: hakem teşvik kriterleri
Chavda paradoksuna bakmaya değer: https://zencapital.substack.com/p/chavdas-paradox
Başta Caleb ve Isaac'in yayımlanan makalelerde AI kullanımını tespit eden iki algoritmanın adı olduğunu sanmıştım, ama aslında AI yardımıyla yazı yazan iki yazarın adıymış
İkisi farklı kararlar verdiyse, her birinin sorunlu diye işaretlediği makalelerin ne kadar örtüştüğünü merak ediyorum
Henüz alfa aşamasında ama birkaç hafta içinde Show HN'de tanıtmayı hedeflediğim bir atıf doğrulama uygulaması olan https://veruscite-data.com/ geliştiriyorum
Üretken AI araçlarına aşina olanlar, yazıda Caleb ve Isaac'in sunduğu işlevleri doğrudan kullanabilir; ama bu araç token açısından daha verimli ve çıkarılan kaynakçayı gözden geçirip düzeltmeyi kolaylaştıran bir GUI sunuyor