1 puan yazan GN⁺ 2 시간 전 | 1 yorum | WhatsApp'ta paylaş
  • NeurIPS, WACV ve ECCV TerraBytes kapsamında incelenen 22 makalenin 15’inde (%68) uydurulmuş atıflar ve yazar listeleri ya da açıkça LLM tarafından üretilmiş cümleler vardı; sahte yazarları bildiren iki makale de kaynakçanın düzeltilmesi şartıyla sözlü sunum olarak kabul edildi
  • 2025 akademik literatüründe yaklaşık 146.900 halüsinasyon atıf bulunduğu tahmin ediliyor; bioRxiv’den yayımlanmış sürümlere kadar izlenen halüsinasyon atıfların %85,3’ü hakemlikten geçtikten sonra da kaldı
  • Sorun başvuruların ötesine hakemliğe de yayıldı: ICLR 2026 değerlendirmelerinin %21’i tamamen yapay zeka üretimi olarak sınıflandırıldı; ICML 2026’da ise LLM kullanması yasak olan hakemlerin yazdığı yaklaşık 795 değerlendirmede LLM kullanımı tespit edildi
  • Sorun LLM kullanımının kendisinden çok doğrulanmamış sonuçların sunulması; kaynakça hataları, metin ile tablolardaki sayısal değerlerin uyuşmaması, sonuçların aşırı pazarlanması ve yalnızca metrikleri tekrar eden tartışma bölümleri, taslağın yeterince incelenmediğinin işareti
  • Kaynakçaları birden çok kayıt kurumu ile karşılaştıran bib-audit yayımlandı; ancak gizli başvuruların bazı kısımlarını barındırılan bir LLM’e gönderdiği için hakemlerin önce ilgili konferansın gizlilik ve LLM politikalarını kontrol etmesi gerekiyor

22 makaleyi incelerken görülen ölçek

  • İki hakem yaz boyunca NeurIPS, WACV ve ECCV’nin jeo-uzamsal çalıştayı TerraBytes kapsamında toplam 22 makale inceledi
    • 15 makalede (%68) tamamen uydurulmuş atıflar, gerçek makalelerin değiştirilmiş yazar listeleri, halüsinasyon ürünü terimler, anlamsız cümleler ve ilgisiz atıflar gibi açık LLM üretimi izleri bulundu
    • Hakemlerden biri 11 makalenin 6’sında (%55), diğeri 11 makalenin 9’unda (%82) bu sorunları tespit etti
  • Konferans bazındaki sonuçlar şöyleydi
    • NeurIPS Datasets and Benchmarks bölümü: 5 makalenin 2’si
    • NeurIPS Position Paper bölümü: 2 makalenin 2’si
    • TerraBytes: sırasıyla 2 makalenin 1’i, 5 makalenin 4’ü
    • WACV: iki hakemin de 4 makalenin 3’ü
  • Yalnızca atıf sorunları nedeniyle desk reject edilebilecek makale sayısı sırasıyla 5 ve 9’du
    • İki WACV makalesi, kaynakçanın ilk maddesinden itibaren gerçek makalenin yazarlarını sahte adlarla değiştirmişti
    • Bir NeurIPS makalesinde 53 sayfa boyunca halüsinasyon ürünü veya anlamsız terimler bulunduğundan kaynakça incelemesinin kendisi anlamsız hale gelmişti
    • İki NeurIPS Position Paper’ın ikisi de LLM üretimi olarak değerlendirildi; TerraBytes için atanan 5 makalenin 4’ünde de sahte atıflar veya yazarlar vardı

Akademik literatür geneline yayılan halüsinasyon atıflar

  • Nisan 2026 tarihli Nature analizi, 2025 yayınlarından en az on binlercesinde hatalı, yapay zeka üretimi kaynakçalar bulunmuş olabileceğini ortaya koydu
  • Zhao ve arkadaşlarının arXiv, bioRxiv, SSRN ve PubMed Central denetimi, yalnızca 2025’te yaklaşık 146.900 halüsinasyon atıf olduğunu tahmin etti
    • Bunlar az sayıda kötü niyetli aktörde yoğunlaşmamış, çok sayıda makaleye ince bir şekilde yayılmıştı
    • Kariyerinin başındaki araştırmacılar ve küçük ekiplerde bulunma olasılığı en yüksekti
    • Halüsinasyon atıf içeren bioRxiv preprint’lerinin yayımlanmış sürümleri izlendiğinde %85,3’ünün aynen kaldığı görüldü
  • The Lancet’in 2,5 milyon biyomedikal makale denetiminde, en az bir sahte kaynakça maddesi bulunan makalelerin oranı iki yılda 6 kat arttı
    • 2023’te 2.828 makalede 1 iken 2025’te 458 makalede 1’e çıktı
    • 2026 başında 277 makalede 1’e ulaştı
  • NeurIPS 2025’te yayımlanan makalelerdeki 100 halüsinasyon atıf analizinde, tüm atıfların 3 ila 5 uzman hakemin incelemesinden geçtiği görüldü
    • Bu atıfları içeren makale sayısı 53’tü; bu da tüm kabul edilenlerin yaklaşık %1’iydi ve halen proceedings içinde yer alıyorlar

Yapay zekanın yazdığı akran değerlendirmesi ve manipülasyon olasılığı

  • Pangram’ın ICLR 2026 analizi, 15.899 değerlendirmenin, yani %21’inin tamamen yapay zeka tarafından üretildiği sonucuna vardı
    • Tüm değerlendirmelerin yarısından fazlasında bir şekilde yapay zeka yer almıştı
  • Organization Science, ChatGPT’nin ortaya çıkmasından sonra başvuruların %42 arttığını ve mevcut akran değerlendirmelerinin %30’dan fazlasında belli düzeyde yapay zeka kullanıldığını ölçtü
  • ICML 2026’daki prompt injection tespiti, LLM kullanması yasak olan Policy A hakemlerinden 506 kişinin yazdığı yaklaşık 795 değerlendirmede LLM kullanımı buldu
    • Bu, tüm değerlendirmelerin yaklaşık %1’ine karşılık geliyor
    • NeurIPS’te de açıkça yapay zeka üretimi etik değerlendirmeleri ve birden fazla yapay zeka üretimi rebuttal gözlemlendi
  • Yapay zeka değerlendirmeleri, makalenin bilimsel içeriğini değiştirmeden özeti hasmane biçimde yeniden yazarak puanı yükseltebilir
    • Li ve arkadaşlarının deneyinde en güçlü saldırı yaklaşık %38 başarı oranına ulaştı
    • 10 puanlık ölçekte Gemini 3 Flash hakeminin kabul puanı 1,31 puan, GPT 5.4 Mini hakeminin puanı 0,88 puan arttı
    • Saldırganın hangi değerlendirme modelinin kullanıldığını bilmesine de gerek yoktu

Gerçek hakemlikte bulunan manipülasyonlar ve ayırt etme sinyalleri

  • En kötü örnekler, gerçek makalelerin konferansını, başlığını ve diğer yazarlarını koruyup yalnızca kişisel olarak tanınan yazarları benzer hayali adlarla değiştiren iki başvuruydu
    • Hakem reddi önerip düzenleyicilere doğrudan bildirmesine rağmen iki makale de kaynakça düzeltme şartlı sözlü sunum olarak kabul edildi
  • SatMAE’ye atıf yapan WACV makalesi yazarları “Yuyang Cong, Saurabh Khanna, Chen Meng, et al.” diye yazdı
  • 53 ve 40 sayfalık NeurIPS makalelerinde halüsinasyon ürünü terimler ve uydurulmuş kaynakçalar vardı; bir makale bazı atıfların yanına LLM iç notları bile bırakmıştı
  • Sahte yazarlar ve tamamen sahte kaynakça maddeleri, taslağın yeterince incelenmediğini ortaya koyuyor
    • İlgili araştırmanın gerçekten okunup okunmadığı, doğru bağlamda atıf yapılıp yapılmadığı ve makalenin, kodun, veri setinin diğer kısımlarına güvenilip güvenilemeyeceği belirsizleşiyor
    • Halüsinasyon kaynakçası olan makalelerin kabule hazır olmadığı ve desk reject edilmesi gerektiği savunuluyor
  • LLM tarafından yazılmış olma olasılığı yüksek sinyaller

    • Yaygın üslup sinyalleri arasında “It’s not X, it’s Y”, “The real X is Y” gibi karşıtlık kalıpları, aşırı kalın yazı ve em dash, yorumlanması zor yoğun cümleler ve sonuçların aşırı pazarlanması yer alıyor
    • Daha incelikli bir sinyal, metindeki sayılar veya metriklerin tablolarla uyuşmaması
    • Deneyler yeniden çalıştırıldıktan sonra ajana tüm sayıları güncellemesi veya doğrulaması söylenmezse bu tür uyuşmazlıklar oluşuyor
    • Claude, ekte veya kodda olması gereken sayıları bile metne sıkıştırma ve tartışma bölümünde tablodaki metrikleri aynen tekrar etme eğiliminde
    • Ortalama ve standart sapma olmadan %1’in altındaki iyileşmeyi SOTA diye adlandıran özel modeller, atıfın yeterli olduğu yerde kullanılan karmaşık formüller ve ekte olması gereken ablation deneyleri de uyarı sinyalleri

Hakemlik işinde ortaya çıkan değişim

  • Özet okunduktan hemen sonra önce kaynakçaya göz atma ve tüm makalenin LLM çıktısı olup olmadığını hızlıca kontrol etme şeklinde hakemlik süreci değişti
  • LLM izlerini aramak daha fazla zaman aldıkça makalelerin iyi niyetle sunulduğu varsayımı da zayıflıyor
    • İlginç, insan tarafından yazılmış ve okunmaya değer makalelerin sayısının ciddi ölçüde azaldığı hissediliyor
    • Ancak halüsinasyon kaynakçaları hariç tutunca, mevcut düşük kaliteli insan yazımı makaleleri incelerken görülen sorunlara benzer pek çok sorun da var
  • LLM kullanımı olgusu tek başına bir değerlendirme ölçütü değil
    • LLM yazıma yardımcı olmuş olsa bile araştırma ilginç, deneyler geçerli ve yeniden üretilebilir ise sorun yok
    • Sorun, incelenmemiş LLM çıktısını olduğu gibi sunup hakemlerden geri bildirim istemek
  • Konferansların başvuru sahiplerine 4-5 değerlendirmeyi zorunlu kılması ücretsiz hakemlik yükünü de artırıyor
    • Hakemler gece veya hafta sonu zaman ayırarak inceleme yapıyor; atıf halüsinasyonları sonradan fark edilirse bu zaman boşa gidiyor
    • Bir araştırmacının değerlendirmelerden öğrenebilmesi için önce kendi çalışmasını yeterince okuyup üzerinde düşünmesi gerekiyor

LLM’i araştırma ve yazımda kullanma biçimi

  • Claude gibi LLM’ler her gün kullanılsa da çıktı mutlaka doğrulanıyor, düzenleniyor ve yeniden yazılıyor
    • Literatür taraması taslağı için Claude kullanıldıktan sonra özgün makaleler ve gönderiler bizzat okunuyor
    • Blogun atıf yaptığı özgün araştırmalar bulunup onların yerine konuyor, materyal yeniden düzenleniyor ve gereksiz ayrıntılar çıkarılıyor
  • Makale gönderilmeden önce tüm taslak dikkatle okunuyor ve kaynakça elle kontrol ediliyor
    • Claude’dan belirsiz kısımları bulması istenip niyeti anlaması için çoktan seçmeli sorularla görüşme yaptırılıyor
    • bib-audit çalıştırıldıktan sonra bile Google Scholar, IEEE, CVF gibi veritabanlarında her madde tek tek kontrol ediliyor
    • Yıllar içinde Zotero’da biriktirilmiş gerçek BibTeX kayıtları da yeniden kullanılıyor
  • Erken aşamada başkalarından geri bildirim alınıyor; gerekirse taslak yazılırken metnin tamamı yeniden yapılandırılıyor
    • Son dakika acele işlerin düşük kaliteli LLM makaleleri ürettiği düşünülüyor
    • LLM öncesinden oluşmuş araştırma sezgisi önemli; genç araştırmacıların yönsüz biçimde araştırma ürettiği bir ortamdan endişe ediliyor
  • Claude’un üslubunu kontrol etme yöntemi

    • Ajanın yazdığı cümleler aşırı yoğun ve akışı kötü olduğundan em dash ve noktalı virgül sınırlandırılıyor
    • Fable 5, em dash yerine iki noktayı aşırı kullanma ve B2B SaaS pazarlama üslubu üretme eğiliminde
    • Ne aşırı saldırgan ne de sönük; alan dışındaki okurların da okuyabileceği cümleler hedefleniyor
    • Bilimsel yazım ile ASD-STE100 Simplified Technical English arasındaki kuralları içeren bir skill etkili oldu
    • Önce metnin amacı ve okuru belirlenmeli, ardından format okura göre ayarlanmalı
    • Claude’un varsayılan üslubu bilimsel okurlar için uygun değil
    • Aşırı kalın yazı, madde işaretli listeler ve pazarlama ifadeleri kalırsa içeriğin kaynağı ve doğrulanıp doğrulanmadığı bile sorgulanabilir

Açık bildirim yerine başvuru aşamasında filtreleme neden gerekli

  • LLM kullanımı bildirme zorunluluğu iyi niyetli araştırmacılar için yararlı olabilir, ancak gerçek davranışı çok değiştirmesi beklenmiyor
    • TorchGeo’ya “LLM kullanılmadı”, “LLM destekli”, “tamamını LLM yazdı” aşamalarından oluşan bir yapay zeka politikası eklendi; ancak son seçeneğin gönüllü olarak seçilme olasılığı düşük
    • LLM ile yazılmış olsa bile sonuçları doğrulanmış ve yeniden üretilebilir iyi bir makale ise kabul edilebilir
  • Yaygın LLM hatalarını bulup taslağın hakemliğe uygun durumda olup olmadığını belirleyecek bir desk reject mekanizması veya işaretleme aracı gerekli
  • Sorumluluk yazarlara, danışmanlara, alan başkanlarına, düzenleyicilere ve konferanslara ait
    • Yazarlar CV doldurmak için çok sayıda düşük emekli makale göndermemeli
    • Danışmanlar ve mentorlar öğrencilerin düşük emekli başvurularını engellemeli
    • Düzenleyiciler büyük başvuru hacmi içinde bunları ayıklamanın yolunu bulmalı
  • Yayın teşvikleri sorunu LLM’lerden önce de vardı; Lipton ve Steinhardt 2018’de matematiksel süsleme, dilin kötüye kullanımı ve uyumsuz teşvikleri özetlemişti
  • LLM ile ders projeleri veya otomatik araştırma sonuçları NeurIPS formatında makale gibi gösterilebilse de gerçek bir araştırma katkısı değilse gönderilmemeli
    • Opus 4.6 ve Karpathy’nin autoresearch deposu kullanılarak LandCoverAI üzerinde SOTA gibi görünen sonuçlar ve bir makale üretilebilmişti; ancak araştırma katkısı olmadığı için gönderilmedi
    • AAAI 2027’ye 48.000 özet gönderildi; otomatik filtreleme probleminin ölçeği daha da büyüdü

bib-audit ile kaynakçanın otomatik denetimi

  • bib-audit, kaynakçadaki başlık, yıl ve tam yazar listesini kayıt kurumu kayıtlarıyla karşılaştıran MIT lisanslı bir Claude Code skill’i
  • .bib, .bbl ve PDF girdi olarak verilebiliyor
    • .bbl ve PDF için Claude, render edilmiş kaynakçayı yapılandırılmış alanlara geri dönüştürüyor
    • Ardından betik her maddeyi Crossref, arXiv, DataCite ve Semantic Scholar üzerinde kontrol ediyor
  • Sonuçlar ciddi hatalardan başlayarak sıralanıyor
    • Var olmayan makaleler
    • Uydurulmuş tanımlayıcılar ve sahte yazarlar
    • Gerçek makalelerin hatalı metaverileri, kırpılmış yazar listeleri, preprint ile yayımlanmış sürüm arasındaki yıl farkları
    • Sayfa aralıklarında tek tire, URL olarak kaydedilmiş DOI, J.D. biçiminde baş harfler gibi biçimlendirme hataları
  • Yalnızca başlığın var olup olmadığını kontrol etmeyip tam yazar listesini karşılaştırdığı için SatMAE örneğindeki gibi yazar değiştirmelerini bulabiliyor
  • DOI veya arXiv ID olmadan yalnızca başlık aramasıyla eşleşen maddeler için kesin hüküm vermiyor; elle kontrol edilmesi gereken öneriler olarak döndürüyor
    • Değerlendirmede motivasyon tahmin edilmemeli; “arXiv kaydındaki ilk yazar Yuyang Cong değil, Yezhen Cong” gibi yalnızca gözlemlenen olgular raporlanmalı
  • .bib kontrolü salt okunur ve ayrı bağımlılık gerektirmiyor; tanımlayıcıyla sabitlenmiş maddelerdeki uyuşmazlıklarda başarısız olacak şekilde ayarlanabildiği için gönderim öncesi CI kapısı olarak kullanılabiliyor
  • Claude dışında npx skills add isaaccorley/skills ile Codex, Copilot, Cursor ve diğer ajanlara kurulabiliyor

Hakemlerin kontrol etmesi gereken gizlilik ve konferans politikaları

  • Denetim süreci gizli başvurunun kaynakçasından bazı kısımları barındırılan bir LLM’e gönderdiği için, değerlendirme yazmakta LLM kullanılmasa bile konferans politikasını ihlal edebilir
  • ECCV 2026 politikası, yerel veya API LLM ile değerlendirme ya da meta değerlendirme yazılmasını yasaklıyor; başvurunun önemli bölümlerinin LLM ile paylaşılması da ayrıca yasak
  • WACV hakem yönergeleri, LLM üretimi değerlendirmeleri çok sorumsuz bir davranış olarak tanımlıyor
    • İhlal halinde hakemin kendi makalesi desk reject edilebilir
    • Gizli materyalin hakem olmayan kişilere gösterilmesi de yasak; barındırılan LLM hakem değildir
  • NeurIPS LLM politikası, hakemlerin LLM hizmetleriyle paylaşabileceği içerikleri sınırlandırıyor
  • Yazarlar gönderimden önce bib-audit’i kendileri çalıştırabilir; ancak hakemler kullanmadan önce mutlaka ilgili konferansın LLM ve gizlilik politikalarını kontrol etmeli

1 yorum

 
GN⁺ 2 시간 전
Hacker News yorumları
  • Şu anda AI araştırma yayın sürecinde makale yazımı, hakemlik, okuma ve özetleme bile AI tarafından yapılıyor
    NeurIPS de AI destekli hakemlik deneyi yürütüyor ve büyük konferanslarda o kadar çok makale var ki insanların hepsini okuması imkansız
    Akademik yayın sürecinde insanlar çok hızlı biçimde otomasyon tarafından dışarı itiliyor

    • Bence mesele insanları yayın sürecinden çıkarmaktan çok, düşük kaliteli makalelerin kitlesel üretimini otomatikleştirmek
      Son EMNLP değerlendirmelerinde benzer bir şey yaşadım ve AI hâlâ araştırma kalitesini değerlendirecek seviyeden çok uzak
      Dürüst akran değerlendirmesi gibi kamusal bir değer suistimal ediliyor, ama hakemlik sistemine erişimi aşırı bir sosyal puan sistemiyle sınırlamak dışında belirgin bir çözüm görünmüyor
    • Bir sonraki adım muhtemelen AI tarafından işletilen dergilerin diğer AI'lardan abonelik ücreti alması ve AI tarafından işletilen üniversitelerin en çok makale ve atfa sahip AI'ı terfi ettirmesi olacak
    • AI kullanımı tespit edilen makalelerin yine de kabul edilmiş olması önemli
      Araştırmacıların çoğu AI'ı aktif biçimde kullandığı için bunu cezalandırmak ya da kendilerini de dezavantajlı duruma sokacak bir ortam yaratmak istemiyor; genel hava endişelenmeyin, kabullenin yönünde
      Sonunda, en başından beri bilimin kendisini gerçekten ciddiye alan insan sayısının çok az olduğu gibi sert bir gerçek ortaya çıkıyor
    • Bu, gıda çöllerine benzer akıl yürütme çöllerini (reasoning deserts) düşündürüyor
      Ekonomik hesaplar yüzünden insan sağlığı ve refahı için gereken gerçek bileşenler olmadan, sadece görünüşte benzer ikamelerin sunulduğu alanlar anlamına geliyor
    • İnsanları otomasyonla dışarı itmekten çok, akademiyi bizzat anlamsız hale getiriyor
      Eğer akademinin genel hali buysa, araştırma fonlarının kesilmesini savunanlara da hak vermeye başlıyorum
  • Bu, yayın yapmazsan yok olursun sisteminin mantıksal sonucu
    Bu sistemi kaldırırsanız sorunun büyük kısmı da ortadan kalkar; yöneticiler basit metrikler istese de araştırmada böyle metrikler yok

    • Bilimde yayın performansı, yazılım geliştirmede yazılan kod satırı sayısını ölçmek gibi
      Teknik borç kısmı da birebir aynı; sayısız makale var ama çoğu muhtemelen tekrar üretilemez ve hangilerinin öyle olduğunu bilmiyoruz
    • O zaman, karmaşık da olsa işe yarar araştırma değerlendirme ölçütleri olup olmadığını merak ediyorum
      Yayın ve atıf performansı manipüle edilebilir ama somuttur; çok atıf alan makaleler genelde faydalıdır ve bunun ödülü yazarlara döner
      Bunu kaldırıp daha iyi bir alternatif kuramazsak, işler bugünkünden de fazla çevre ve hitabet becerisine bağlı hale gelebilir
    • Profesörler zaten makalelerin dışında ders verme, hizmet, komite yürütme, lisansüstü öğrenci danışmanlığı ve mezun ettirme gibi pek çok şartı karşılamak zorunda ve bunların hepsi kadro değerlendirmesinde hesaba katılıyor
  • AI'ın ürettiği hataları olduğu gibi teslim etmek, intihale yakın bir ihlal sayılmalı ve benzer cezalar uygulanmalı

    • AI kullanımını dürüstçe açıklamazsanız dergi başvurularının 1 yıldan uzun süre yasaklanmasına yönelik politikaların zaten uygulanmaya başlandığını biliyorum; arXiv de benzer bir yöne gidiyor gibi görünüyor
      Açıklama yapıp yapmamak ile aşırı kullanım farklı şeyler, ama halüsinasyonları ve hataları bile kontrol etmediyseniz, asıl sorun AI'dan çok beceriksizlik ve tembellik
  • arXiv aylık gönderim istatistikleri bence logaritmik ölçeğe çevrilmeli
    2027'de akademi Moltbook gibi bir şeye dönüşebilir gibi görünüyor

    • Eğer logaritmik artış eğilimi LLM makaleleri çağından önce başladıysa, bunun sadece arXiv ön baskılarının artan popülaritesini yansıttığını safça umabiliriz
    • Genel yön doğru, ama alanlar ve alt alanlar arasında durum çok farklı
      Düşük kaliteli makaleler gösterişli ve büyük konulara yığılıyor; özellikle makine öğrenimi çok kötü durumda, ama önemli olup da niş kalan ve bu tür yazarların henüz bulaşmadığı konular da var
      O alanlar hâlâ ciddi araştırmacılar tarafından sürükleniyor, ama doğrudan çalışmazsanız var olduklarını bilmek zor
  • Bu, akademinin makaleler ve dergilerin açık erişilebilirliğini ciddiye almamasının bir yan etkisi
    Makaleler dergilerin erişim kısıtına takılmasaydı, atıf yapılan makalelerin ve alıntıların gerçekten var olup olmadığını doğrulamak kolay olurdu

    • Sorun, akademiden çok yayınevlerinin markaya yaslanarak mümkün olan en yüksek kârı çıkarmaya çalışması
      Akran değerlendirmesi ödül olmadan sadece itibar kazandırıyor; platform ve yayınevi ise kazancı topluyor; bu, Reddit moderatörlüğüne benziyor
      Yapı şöyle: yazar yayın ücretini ödüyor, başka bir yazar da ücretsiz düzeltme yapıyor; bu yüzden akademisyenlerin ön baskıları ya da popüler makaleleri kişisel sitelerine koyması doğal bir tercih
    • Bir makalenin gerçekten var olup olmadığı, çoğu durumda derginin açık indeks kaydı, yazar ve özet bilgileri ile DOI atfı üzerinden kapalı dergilerde bile kolayca doğrulanabilir
      Ancak atfın içeriğinin gerçekten iddiayla uyuşup uyuşmadığını doğrulamak için makaleyi okuyup yorumlamak gerekir; bu yüzden yalnızca açık erişimle iş basitleşmez, AI ile ilk kontrol yapılsa bile çok zahmetli bir iştir
    • Bu, her grupta tekrar eden insan kaynaklı kronik bir başarısızlığı gösteriyor: Kimse kendi evini temizlemek istemiyor
    • Atıf yapılan makalelerin gerçekten var olup olmadığını doğrulamak zaten kolay
    • En azından biyomedikal araştırmalarda, çoğu yayın ya hemen ya da 1 yıl sonra açık erişime geçiyor
  • Bir konferansa makale gönderince zorunlu olarak 4-5 makaleye hakemlik yapmak gerektiği gerçekten doğru mu diye merak ediyorum
    Bu durumda düzgün makaleler bile kaynağı ve uzmanlığı bilinmeyen insanlara zorla incelettiriliyor demektir

    • Evet ve 4-5 bile düşük bir sayı
      Ben zorunlu olarak 7 makale değerlendirdim; 30 bin makale içinden istediğim 30'una başvurdum ama bir tanesi bile verilmedi, onun yerine yeterli uzmanlığım olmayan 7 makale verildi
    • ACL ekosistemindeki konferanslarda tamamen rastgele kişiler seçilmiyor; ana ACL etkinliklerinde ya da Findings'te en az 2 makale ve ACL Anthology veya büyük ML/AI konferanslarında en az 1 ek makale yayımlamış yazar olmanız gerekiyor
      Ancak gönderimler artmaya devam ediyor ve gönüllü hakem sayısı yetersiz olduğu için zorunlu hakemlik gerçekten uygulanıyor: hakem teşvik kriterleri
  • Chavda paradoksuna bakmaya değer: https://zencapital.substack.com/p/chavdas-paradox

  • Başta Caleb ve Isaac'in yayımlanan makalelerde AI kullanımını tespit eden iki algoritmanın adı olduğunu sanmıştım, ama aslında AI yardımıyla yazı yazan iki yazarın adıymış
    İkisi farklı kararlar verdiyse, her birinin sorunlu diye işaretlediği makalelerin ne kadar örtüştüğünü merak ediyorum

  • Henüz alfa aşamasında ama birkaç hafta içinde Show HN'de tanıtmayı hedeflediğim bir atıf doğrulama uygulaması olan https://veruscite-data.com/ geliştiriyorum
    Üretken AI araçlarına aşina olanlar, yazıda Caleb ve Isaac'in sunduğu işlevleri doğrudan kullanabilir; ama bu araç token açısından daha verimli ve çıkarılan kaynakçayı gözden geçirip düzeltmeyi kolaylaştıran bir GUI sunuyor