Bilgisayar Bilimi öğrencisi, açılmamış Herculaneum tomarında 2.000 yıl sonraki ilk sözcüğü keşfetti
(scrollprize.org)- MS 79’daki Vezüv Yanardağı patlamasında kömürleşen Herculaneum tomarları, açıldığında parçalanacak kadar kırılgan olsa da CT taramaları ve makine öğrenmesiyle içindeki yazıların okunabileceği olasılığı doğrulandı
- Vesuvius Challenge katılımcısı Luke Farritor, açılmamış bir tomarın içinde eksiksiz bir sözcük bularak $40,000 First Letters Prize ödülünü aldı
- Bulunan sözcük antik harflerle ΠΟΡΦΥΡΑϹ; modern yazımı “porphyras” ve “mor” anlamına geliyor, ancak bağlam ve sözcük sınırlarını kesinleştirmek hâlâ zor
- Casey Handmer’ın crackle pattern keşfi, Luke ve Youssef Nader’in modellerini geliştirmesine yol açtı; Youssef aynı bölgede daha net ve bağımsız bir sonuçla $10,000 ikincilik ödülünü aldı
- Açık yarışma, açık kaynak araçlar ve segmentasyon çalışmaları birleşince $700,000 Grand Prize gerçekçi ve yakın bir hedef hâline geldi
2.000 yıl boyunca açılamayan tomardan çıkan ilk sözcük
- Herculaneum papirüsleri, Pompeii yakınlarındaki özel bir villanın kütüphanesinde bulunan antik tomarlardı; MS 79’daki Vezüv Yanardağı patlamasında gömülüp kömürleştiler
- Bu kütüphane, antik çağdan günümüze ulaşan tek kütüphane; yaklaşık 2.000 yıl boyunca 20 m volkanik çamurun altında gömülü kaldı
- 1700’lerde kazıyla çıkarıldı, ancak tomarlar yanlış tutulursa toza dönüşecek kadar kırılgan olduğundan fiziksel olarak açıp okumak zordu
- Luke Farritor, Ağustos 2023’te açılmamış bir tomarın içinde eksiksiz bir sözcük gören ilk kişi oldu ve $40,000 First Letters Prize ödülünü aldı
- Bu ödül, tomarın 4 cm²’lik bir bölgesinde en az 10 karakter bulunmasını gerektiriyor
- Youssef Nader de aynı bölgede aynı sözcüğü bağımsız olarak keşfetti ve daha net sonucu sayesinde $10,000 ikincilik ödülünü aldı
- Yayınlanan kodlara Luke ve Youssef GitHub sayfalarından ulaşılabilir
CT taramaları, doğruluk verisi ve Vesuvius Challenge’ın başlangıç noktası
- 2019’da University of Kentucky EduceLab’den Profesör Brent Seales, Herculaneum tomarlarını bir parçacık hızlandırıcıyla görüntüleyerek 4µm’ye kadar çözünürlükte 3B CT taramaları oluşturdu
- Araştırma ekibi, görünür mürekkebi kalan ayrılmış parçaları da tarayıp fotoğraflayarak doğruluk veri seti hazırladı
- Stephen Parsons, ayrılmış parçaların CT taramalarında makine öğrenmesiyle mürekkep algılama üzerine çalıştı ve bu parçalarda sonuç aldı
- Nat Friedman ve Daniel Gross bu ilerlemeyi hızlandırmak için Vesuvius Challenge’ı başlattı
- Mart 2023’te açık bir yarışma düzenlendi
- $700,000 Grand Prize ile birlikte açık kaynak araç ve teknoloji geliştirmeye yönelik çeşitli küçük ödüller sunuldu
- Yaz başından itibaren segmentasyon ekibi katılarak tomarların 3B yapısını haritaladı; Temmuz’a kadar yüzlerce cm² papirüsü segmente edip sanal olarak açtı
Casey Handmer’ın bulduğu mürekkep sinyali
- Casey Handmer, Ağustos 2023 başında CT taraması segmentlerini uzun süre inceledikten sonra mürekkebe benzeyen bir crackle pattern keşfetti
- Stephen Parsons daha önce ayrılmış parçalarda mürekkebe dair doğrudan kanıt görmüştü, ancak açılmamış tomarların içinde bu henüz doğrulanmamıştı
- Casey, açılmamış bir tomarın içinde mürekkep ve harfler bulan 2.000 yıl sonraki ilk kişi oldu
- Bu keşif hem Luke’un modeli hem de Youssef’in yaklaşımı için doğrudan başlangıç noktası oldu ve Casey $10,000 First Ink Prize ödülünü aldı
Luke Farritor’ın modeli ve “porphyras”
- Luke Farritor, üniversite öğrencisi ve SpaceX Starbase yaz stajyeriydi; Vesuvius Challenge’dan Dwarkesh Patel’in Nat Friedman röportajı sayesinde haberdar oldu
- Discord’da Casey’nin crackle pattern tartışmasını gördükten sonra akşamlarını ve gecelerini bu deseni öğrenen bir makine öğrenmesi modeli eğitmeye ayırdı
- Her yeni crackle keşfedildiğinde model gelişiyor, gelişen model de yeniden daha fazla crackle ortaya çıkarıyordu; böyle tekrarlayan bir döngü oluştu
- Model onlarca mürekkep darbesi ve bazı eksiksiz harfler buldu; bunlar eğitim için etiket verisi olarak kullanıldı
- Zamanla model, insan gözünün göremediği crackle izlerini bile ortaya çıkardı; bu izler harf ve sözcükler için ipucu oldu
- Luke’un ilk gönderiminde ΠΟΡΦΥΡΑϹ, yani “porphyras”, silik biçimde belirdi
- Profesör Brent Seales bu görüntüyü papirologlara gösterdiğinde, onlar silik harflere rağmen “porphyras”ı hemen okudu
- Teknik incelemenin ardından yeni görüntü papirolog paneline gönderildi; panel bağımsız ve oy birliğiyle 13 karakteri anotasyonladı
- Güven düzeyi %80’in üzeri, %50–80 ve %50’nin altı olarak ayrıldı
- “porphyras”, “mor” anlamına geliyor ve antik metinlerde çok nadir görülen bir sözcük
- Bir papirolog, bağlam eksikliği nedeniyle bunun isim olarak “mor boya veya mor kumaş” mı, sıfat olarak “mor” mu, yoksa farklı bir sözcük sınırı mı olduğunun dışlanamayacağını değerlendirdi
- Dönemin metinlerinde boşluk kullanılmadığı için sözcük sınırlarını belirlemek daha da zor
Youssef Nader’in bağımsız yaklaşımı
- Youssef Nader, Berlin’de Mısırlı bir biyorobotik yüksek lisans öğrencisi; Casey ve Luke’un sonuçlarından etkilenerek farklı bir yöntem denedi
- Önce Kaggle Ink Detection prize kazananlarını inceledi
- Bu yarışma, Stephen Parsons’ın ayrılmış parçalara dayalı makine öğrenmesi yaklaşımını geliştirmeye odaklanmıştı
- Youssef, tomar verileri üzerinde gözetimsiz ön eğitim ve parça etiketlerine dayalı ince ayar ile modeli tomarlara uyarladı
- “Ink Detection Followup Prize” fikriyle küçük bir ödül aldıktan sonra, Luke’un ilk sonuçları X ve Discord’da paylaşılınca aynı bölgeye odaklandı
- Kaggle yarışmasından uyarladığı modelle bazı harfleri buldu; Casey’nin yöntemindeki gibi crackle’ları elle aramadı
- Harfe benzeyen şekilleri etiket verisi olarak anotasyonladı ve bunu yinelemeli pseudo-labeling ile genişletti
- Nihai model yalnızca iç tomar segmentleriyle eğitildi ve bu sonuçla First Letters Prize ikinciliğini elde etti
- Papirologlar Youssef’in sonucunda harfler konusunda daha güçlü bir uzlaşı gösterdi; üst taraftaki olası “ανυοντα / ANYONTA” sözcüğünü ve alt taraftaki “ομοιων / OMOIωN” olasılığını da inceledi
- Bu sözcükler doğruysa ilgili papirüs tomarı, modern dünyanın bilmediği tamamen yeni bir metin içeriyor olabilir
Açık yarışma ve açık kaynağın kurduğu bağlantı
- Birçok kişinin katkısı keşif yoluna doğrudan bağlandığı için, competition + open source ve kademeli ödül yapısının gerçekten işe yaradığını gösteren bir örnek ortaya çıktı
- Youssef Kaggle yarışma modelinden yararlandı ve Luke’un sonucundan esinlenerek aynı bölgeyi inceledi
- Luke’un crackle arayışı doğrudan Casey’nin çalışmasından yola çıktı
- Casey, segmentasyon ekibinin yüzlerce cm²’yi önceden haritalamış olması sayesinde çok sayıda papirüs yaprağını inceleyebildi
- Segmentasyon ekibi, Segmentation Tooling Prizes katılımcılarının geliştirdiği araçlar sayesinde geniş alanları haritalayabildi
- Julian Schilliger, Chuck, Yao Hsiao ve diğer birçok katılımcının çalışmaları buna dahildi
- Bu araç iyileştirmeleri, Brent Seales ekibinin mevcut açık kaynak araçları üzerine inşa edildi
- Seth Parker, Stephen Parsons ve başkalarının çalışmaları temel oluşturdu
- Şimdiye kadarki gidişata bakıldığında yarışma operasyonunun neredeyse her unsuru load-bearing bir rol oynadı; ilerleme, sonradan göründüğünden daha kırılgan ve tesadüfi olabilir
$700,000 Grand Prize’a doğru sonraki adımlar
- Segmentasyon ekibi ve katılımcılar ilerleme kaydetmeye devam ediyor; Youssef’in modeli birkaç gün önce daha net ve daha büyük yeni bir görüntü üretti
- Yeni görüntüde, boşluklarla ayrılmış 4,5 sütun metin açıkça görülebiliyor
- Daha fazla harf görünüyor, ancak hepsi hemen okunabilir durumda değil; papiroloji ekibi ek inceleme yapıyor
- Vesuvius Challenge, bu ilerlemenin $700,000 Grand Prize hedefini ulaşılabilir kıldığını düşünüyor
- Katılımcılar Discord topluluğu, Substack bülteni ve X hesabı üzerinden katılabilir; verileri ve eğitimleri, kazananların çalışmalarını ve topluluk araçlarını inceleyerek başlayabilir
- Amaç, yüzlerce tomarın içindeki bilgiyi açığa çıkarmak, antik metinlerin miktarını ikiye katlamak ve henüz kazılmamış binlerce tomarın da okunabilme olasılığını yaratmak
1 yorum
Hacker News görüşleri
Harfler, CT taramasındaki papirüs parçalarında Yunan harfi şekline benzeyen çatlak dokuları bulunup eğitim verisi olarak etiketlenirken keşfedilmiş
Ancak bu tür çatlak dokuları çoğu papirüste çıplak gözle görünmüyor; muhtemelen yalnızca mürekkebin çok kalın sürüldüğü yerlerde böyle görünüyor
Elektron mikroskobu görüntüsünde https://scrollprize.org/img/tutorials/sem.png doku farkı çok daha iyi görülüyor; özellikle mürekkebin itildiği kenarlarda belirgin
Kaggle mürekkep tespit yarışmasından sonra çatlakların keşfedilmiş olması şaşırtıcı. Casey Handmer da https://caseyhandmer.wordpress.com/2023/08/05/reading-ancien... bilinen harf mürekkepleriyle eşleşen “çatlamış çamur” ve “pul pul dökülme” dokuları aradığını, ama bunların bilinen harflerin yalnızca yaklaşık %10’unda bulunduğunu yazmıştı
Yeni görüntü beklenenden çok daha iyi, ama hâlâ yalnızca küçük bir bölge olduğu için birkaç tuhaf cümleden fazlasını okuyabileceğimiz konusunda hâlâ kötümserim
Tüm harfler insan gözüne net görünmeyebilir; tarama görüntüsünde çok fazla katman var, bu yüzden görüntüler arasında gezinirken desenlerin ortaya çıkması zaman alıyor diye düşünüyordum
Her piksel sütununu yukarı-aşağı bilineer enterpolasyonla işleyerek görüntü bloklarını “hizalayan” ve çatlak dokusunu düzleştiren, hatırladığım kadarıyla toplam varyans kaybını en aza indiren bir kod yazmıştım
Sonra “düzleştirilmiş” görüntü üzerinde optimize edilmiş bir 2D evrişimli sinir ağı kullanmayı planlıyordum; tomarın kesitine bakınca, ahşap gibi yerel olarak tutarlı ezilme gösteren kısımlar olduğu için enterpolasyonun yeterli olabileceğini düşünmüştüm
Bu yüzden bu problemde 3D evrişim kullanılmasına pek katılmıyordum. Sürülüp kurumuş mürekkep, 2D evrişimle tespit edilebilecek yarı öngörülebilir bir örüntü izler; istenen değişmezlikler de önceden daha kolay yapılandırılabilir diye düşünüyordum
Kodla ilgileniyorsanız bulup paylaşabilirim
Nat’in Twitter duyurusu da görülmeye değer: https://twitter.com/natfriedman/status/1712470683207532906
700 bin dolar hayat değiştirecek bir para; insanın her şeyi bırakıp modern makine öğrenmesiyle antik bilgeliğin peşine düşen bir keşiş gibi kendini adaması geliyor
Tomarların sıradan bir çamaşır listesi çıkma ihtimali de komik
Üstelik “kazı tamamlanmadı ve birçok tarihçi yerin altında binlerce tomarın daha kaldığına inanıyor” deniyor: https://scrollprize.org
Çamaşır listesi olsaydı pahalı papirüs yerine yeniden kullanılabilir balmumu tablete yazılırdı
Daha sonraları imparator ailesi dışındaki birinin mor giymesi ölüm cezası gerektiren bir suç hâline geldi; Vezüv patlaması sırasında da böyle miydi bilmiyorum ama Wikipedia, Caligula’nın mor giydiği için birini öldürmüş olabileceğini söylüyor
Klasik edebiyata başlamanızı şiddetle öneririm. Gerçekten şaşırtıcı ve hayal gücünün ötesinde; eğitim sırasında biraz temas etmiştim ama büyüklüğünü ancak yakın zamanda fark ettim
Yeni başlayanlara Iamblichus’un Life of Pythagoras’ını, Apuleius of Numenia’nın The Golden Ass’ini (Robert Graves çevirisi), Plutarch’ın Life of Alexander’ını, Xenophon’un Education of Cyrus’unu ve Plato’nun Parmenides’ini öneririm
SHWEP.net de birçok klasiğe yumuşak ama titiz bir rehberlik sağladığı için çok faydalı oldu; nispeten ezoterik bir yönü var ve bu tarafını da seviyorum
Klasik edebiyata birkaç kez dokundum ama hep okuması zor geldiği için sonuna kadar okumaya motivasyon bulamadım; bu türde kaçırdığım bir şey olup olmadığını merak ediyorum
Pisagor muhtemelen tarihin en büyük filozofuydu. Onun manevi ardılı Archytas’ı da okumanızı öneririm; matematik, mekanik, müzik, öğrenme ve felsefeye dair fikirleri şaşırtıcı
Plato’ya en iyi giriş olarak Alcibiades’i tavsiye ederim. Keyifle okunacak kadar hafif ama aynı zamanda derin ve çarpıcı: https://www.gutenberg.org/ebooks/1676
Bu konuyla ilgili yakın zamanda harika bir YouTube videosu izledim: https://www.youtube.com/watch?v=Z_L1oN8y7Bs
Başlığı “Herculaneum scrolls: A 20-year journey to read the unreadable” ve bunun hangi teknolojiyle başarıldığına biraz değiniyor
Taramalar 10 yıl öncesinden beri vardı, ancak kâğıt ile üzerindeki mürekkebi ayırt etmek için makine öğrenimi eğitimi gerekiyordu; 20 yıl önce ise kontrastı daha yüksek malzemelerden yapılmış başka bir tomar setinde bu zaten mümkün olmuştu
Derin öğrenme, daha önce algoritmalarla çözülemeyeceği düşünülen veri kümelerinin şifresini çözüyor
Şu ana kadar gözle görülmesi çok zor olan çok sayıda harf bulunmuş gibi de görünmüyor
Orijinal metinde, model çıktısının yönlendirdiği elle açıklama ekleme ve modeli ek verilerle yeniden eğitme döngüsünü okumak ilginç
Baştan itibaren kullanılabilir doğru cevap verisiyle derin öğrenmeyi çalıştırıp modelin bakması gereken özellikleri bilmezseniz, pratikte neredeyse hiç işe yaramıyordu
Üstelik tomarı sanal olarak açma süreci de şu anda büyük ölçüde manuel ve emek yoğun
Şimdi burada insanın yaptığı işi derin öğrenme modeline yaptırmaya çalışıyorlar, ancak henüz gerçek harfleri bulmayı başarmış değil
Bu, 21. yüzyılda Tutankhamun’un mezarının açılışını yaşamak gibi
Orta vadeli gelecekte, binlerce yıldır kimsenin okuyamadığı yeni çevrilmiş eserleri Amazon’dan satın almanın gerçekçi bir olasılık olması inanılmaz derecede şaşırtıcı
Gerçekten harika. Buradan ne öğreneceğimizi merak ediyorum
Bu arada “Professor Seales ve ekibi parçacık hızlandırıcıda tarama yaparken” fotoğrafı bir TV dizisi sahnesi gibi. “Bilgisayara sürekli ‘enhance’ dersen okuyabiliriz” hissi veriyor
Gördüğüm en uç veri kurtarma örneklerinden biri sayılabilir
2000 yıl sonra “atılmış bir sabit disk plakasında bulunan ilk dosya” gibi bir şey yaşanır mı merak ediyorum
Bu röportajın ilk 30 dakikası şu anda neler olduğunu çok iyi açıklıyor. Gerçekten ilginç
https://youtu.be/qcvMjoJdck4?si=RL1WnAAj4loS1D2s
“ex-JPL startup founder and polymath” ifadesi ilginç
Çok yönlü bir insan olduğum için hiç böyle bir övgü almadım; benim aldıklarım “generalist” ve “dikkatli değerlendirme sonucunda başvuru sürecinizi ilerletmemeye karar verdik” oldu
Tanınmaya karar verseler bile, “yeterince ünlü olmama” gibi affedilmez bir günah yüzünden kenara itildiklerini gördüm
https://scrollprize.org/ asıl meydan okumayı açıklıyor
Başka araştırmalar, CT taramalarına dayalı sanal açmanın mümkün olduğunu göstermişti; ancak bu tomarların mürekkebi CT/X-ışınlarında belirgin görünmediği için daha ince yapısal değişikliklere dönmek gerekti
Bunun kâğıt yapısının değişmesi mi olduğu, yoksa gerçek mürekkebin görünüp yalnızca daha az belirgin mi olduğu kesin değil