2 puan yazan GN⁺ 2023-09-18 | 1 yorum | WhatsApp'ta paylaş
  • Linear Book Scanner, düşük maliyetle otomatik sayfa çevirme ve tarama yapan açık kaynaklı bir kitap tarayıcısıdır
  • Kitap, cihazın üzerinde ileri geri hareket ederken sayfa çevirme ve tarama sıralı olarak gerçekleşir
  • Her hareket döngüsünde vakum emişi, bir taraftaki sayfayı diğer tarafa çevirir
  • Sayfalar, iki adet görüntüleme sensörünün yanından geçerken taranır
  • Özel yazılım, tarama sonuçlarını aranabilir PDF haline getirerek kullanım değerini artırır

Sayfa çevirerek tarama yapan yapı

  • Linear Book Scanner, düşük maliyetli sayfa çeviren bir kitap tarayıcısı olarak tasarlanmıştır
  • Tasarım açık kaynak olarak yayımlandığı için herkes tarafından doğrudan üretilebilir
  • Kitap, makinenin üzerinde ileri geri hareket eder ve her geçişte vakum, sayfayı bir taraftan diğerine emerek çevirir

Tarama çıktıları

  • Sayfalar, iki adet görüntüleme sensöründen geçerken taranır
  • Yazılım, taranan kitabı aranabilir PDF olarak oluşturur

1 yorum

 
GN⁺ 2023-09-18
Hacker News yorumları
  • Bu konu için https://diybookscanner.org/ adresinde bir topluluk var.
    Birkaç yıl önce Java ile bookbuilder adlı küçük bir araç yapmıştım; sayfaları elle çevirip fotoğraflarını çektikten sonra tüm görüntüleri otomatik işleyerek aranabilir bir PDF oluşturabiliyordu.
    https://boofcv.org/ adlı saf Java bir bilgisayarlı görü kütüphanesi kullandım; hâlâ var ve oldukça hızlı.
    Sayfa konturunu algılama, eğim düzeltme, görüntüyü düzleştirme, cilt tonu eşleştirme yoluyla parmak konturlarını kaldırma gibi işlemleri otomatik yaptıktan sonra, kullanıcı müdahalesi olmadan görünmez OCR katmanı içeren bir PDF oluşturabiliyordu.
    Düzleştirmeyi iyileştirmek için bir tür watershed algoritmasıyla çizgi eğimi algılama üzerinde de çalıştığımı hatırlıyorum.
    Eğlenceli bir projeydi; kaynak kodunun bir yerlerde durup durmadığını merak ediyorum. İndirme sayfası da artık yok ve o zamanlar böyle küçük bir yan projenin başkalarının ilgisini çekeceğini düşünmediğimden açık kaynak olarak yayımlamadan önceki dönemdi.

    • https://diybookscanner.org/ üzerindeki asıl kitap tarayıcı forumu şu anda birkaç haftadır kapalı ve geri getirilmesi üzerinde çalışılıyor.
    • Eskiden beri kitap taramaya ilgim vardı ve muhtemelen bu yazılımı gördüğümü hatırlıyorum.
      Sitede gördüğüm ilk sürümlerden birini yapmıştım; birkaç yıl önce de tesadüfen Jonathon Duerig ile tanışıp onun için su jeti kesim işi de yaptım.
      İlk lineer kitap tarayıcıyı gördüğümde bana ters yapılmış gibi gelmişti. Asılı bir yapı olarak kendi kendine hareket edebilse, kitabın kütlesini bilme veya sürtünmeyle uğraşma sorunlarından kaçınılabilir.
      Karşı ağırlık ile kuvvet sabit tutulabilir ve hangi kitap taranırsa taransın yalnızca bilinen bir kütle hareket ettirilmiş olur.
    • BoofCV gerçekten harika.
      Bugüne kadar bilmemiş olmam üzücü; bilseydim öğrenmek ve katkı vermek için zaman ayırırdım gibi geliyor. Hâlâ mümkün olabilir ama şimdi bakınca duyduğum neredeyse tüm özellikleri ve daha fazlasını zaten kapsıyor gibi görünüyor.
      Örnekleri tek tek tıklayarak 30 dakika geçirdim.
    • Mümkünse GitHub’da yayımlasanız iyi olur.
  • Benzer ticari tarayıcılar var [1] [2]; bu da V şeklinde bir tasarım, ancak yukarıdan tarama yapacak şekilde ters çevrilmiş.
    Kitap hareket etmediği, tarayıcı hareket ettiği için kitap üzerinde çok daha nazik çalışıyor.
    Bu yaklaşımın açık kaynak bir alternatifinin geliştirildiğini görmek çok sevindirici.
    [1] https://www.treventus.com
    [2] https://youtu.be/SdipuAuWsEs?si=dFWRtva5gO2oM91o

    • Kiralama ya da ödünç alma veya dijitalleştirme hizmeti kullanma da muhtemelen pahalıdır.
      Çünkü her iki seçenek için de fiyat bilgisi açıkça verilmemiş; yalnızca iletişim formu doldurtuyorlar.
    • Orijinal projeyle ilgili Google sunumunda da bu cihaz ele alınıyor.
      https://youtu.be/4JuoOaL11bw?si=do1qet5Kq_WErQgz&t=162
    • Aynı fikrin DIY sürümü burada: https://www.diybookscanner.org
    • Bu tarayıcı her taramada bir sayfayı kesip ayırdığı için bunun harika bir alternatif olduğundan pek emin değilim.
      Ondan sonra ne kadar nazik davrandığının pek anlamı kalmıyor gibi.
      Kalan sayfaları yeniden ciltleyip yeni bir kitap yapmayı düşünüyorsanız belki olabilir.
  • Fikir hoşuma gidiyor ama koruma amacıyla ya da değerli kitaplar için sayfa yırtılması riski biraz endişe verici.
    Böyle durumlarda zaten elle taramayı tercih ederdim, fakat dijitalleştirmek istediğim çok fazla kitap olduğu için böyle bir cihaza sahip olmayı sık sık istemiştim.
    FAQ’de yırtılan sayfa sıklığına dair açıklamaya bakınca:

    Prototype 1 could scan the majority of books without damage, but may tear one or two pages in some books. Out of 50 books tested, 45% had one or two of their pages either torn or folded. This is a very early prototype and there are many areas for improvement in the design.
    Kişisel olarak bu genel olarak kabul edilebilir. Özellikle sonraki sürümlerde %45’i %10–20 civarına düşürürlerse, böyle bir cihaza yer ayırabilecek olsam yapmayı düşünürdüm.

    • Internet Archive bir süre, kitabı V şeklinde bir beşiğe yerleştiren kitap tarayıcıları yaptı.
      Gönüllü sayfaları elle çeviriyor; iki cam levhayı indirip kaldırarak sayfaları nazikçe bastırıyor ve açılı bir düzeneğe yerleştirilmiş iki DSLR kamera fotoğraf çekiyor.
      Tüm cihaz otomatik değil ama elle kolayca kullanılabiliyor.
      https://blog.archive.org/2021/02/09/meet-eliza-zhang-book-sc...
    • Henüz görmediyseniz bu site ziyaret etmeye değer.
      https://www.diybookscanner.org/en/intro.html
    • Yeri doldurulamaz bir kitapsa, örneğin eski ve baskısı tükenmiş bir kitapsa, bu hiç kabul edilemez.
      Yırtılan sayfa sayısı 0 olmalı.
      Bilgisayarlardan önce elektronik kopyalar da yoktu.
  • Bu alanda yazılım henüz mümkün olan seviyeyi yakalayamadığı için, insanların yazılımla yapılabilecek işleri donanımla çözdüğü görülüyor
    İki ya da daha fazla fotoğraf veya stereoskopik görüntü, örneğin yeni bir iPhone gibi bir giriş varsa, üçgenleme ile düzleştirilmiş sayfayı tahmin edip düz yataklı tarayıcıdan kesilmiş bir sayfa gibi görünen bir görüntü oluşturmak mümkün
    Sonrasında Etiyopya’da kitabı zarar vermeden dikkatlice çevirecek kişiye yeterli ücret ödemek yeterli
    Her araştırmacının bildiği gibi, bugünün dijital kütüphanelerinde kalitesi şüpheli tarama işlerinden bir yüzyıllık birikim var
    Yapay zeka, 8K monitörde özgün kontur font biçiminden ayırt edilmesi zor taramalar tahmin edebilir
    Eskiden 1980’lerdeki font savaşlarıyla ilgili olarak, eski formatları ve dijital taramaları PostScript ve TrueType fontlarına dönüştürme konusunda danışmanlık yapmıştım
    O zamanlar zordu ama yazılım yetiştiğinde bunun metin taramanın doğru yolu olduğu anlaşılacak
    Bilimsel literatür için her sayfayı yeniden üretebilecek LaTeX kaynaklarını geri çıkaran ChatGPT benzeri bir şeye ihtiyaç var. Aslında sabit metin ve akışkan metni aynı kolaylıkla yazdırabilen, daha az anlaşılmaz bir LaTeX halefine gerçekten ihtiyaç var

    • Bu çok fiziksel bir sorun ve kullanılabilecek pek fazla kestirme yol yok
      Bir koruma projesinde yer alıp gerçekten çok sayıda dergi taradım; genel olarak düz yatağın üzerine koyup koymamak çok da önemli değildi. Her durumda sayfaları elle çevirmek zaman alıyor
      Dergileri ve kitapları çok hızlı taramanın bilinen yöntemi zaten var: sırt cildini kesip sayfaları otomatik tarayıcıya vermek
      Elbette taramadan sonra nesneyi korumak istiyorsanız bu uygulanamaz, çünkü kopya yok edilmiş olur
      Sonuçta nesneye zarar vermeden taramayı otomatikleştirmenin en iyi yolu, üstten kamera ile sayfa çevirme makinesini birleştirmeli. Google’ın büyük ölçekli tarama projesinin de böyle olduğunu düşünüyorum
      X-ışınıyla sayfaları çevirmeden bazı kitapları “taramak” da mümkün olabilir, ama orada da yeni sorunlar çıkacak gibi
    • Üçüncü dünya emeğini sömürmek için altyapı kurmanın tam olarak nasıl bir yazılım sorunu olduğunu bilmiyorum
      Sorun, yazılımın bozulma düzeltmesini iyi yapamamasından ziyade, kitap tarama için tüm hazırlığı yaptıktan sonra bozulma düzeltmesine ihtiyaç duymayan bir cihaz kullanmanın daha iyi olması
    • Yazılım bunu 2017’de zaten yapabiliyordu. Görme engelliler için bir cihazda temelde bu işi yapmıştım ve stereoskopik görüntüye de gerek yoktu
      Düzleştirmenin nasıl çalıştığını burada görebilirsiniz. Bu kısmı kütüphane hallediyordu, bu yüzden ayrıca kod yazmam gerekmemişti
      https://youtu.be/DPu0iJtK2sI?t=1542
      Sayfayı çevirmenizi bildirme, çevrilip çevrilmediğini algılama ve fotoğraf çekme özellikleri de var. Arka planda fotoğrafı düzleştiriyor, sayfaları ayırıyor ve OCR yapıyor
      Biraz alışınca bir kitabı sayfa başına 1–5 saniyede tarayıp OCR’dan geçirebilirsiniz
      https://youtu.be/DPu0iJtK2sI?t=1909
      Ardından OCR’dan geçirilmiş kitabı saklıyor ve istediğiniz zaman size okuyor
    • LaTeX halefi olarak https://typst.app/ oldukça iyi bir yer edinmiş durumda
    • Yapay zeka kesinlikle olmaz. Dijitalleştirme sürecinde metnin ince biçimlerde değişmesi en çok kaçınılması gereken şey
      https://news.ycombinator.com/item?id=29223815
      İnandırıcı ama yanlış sonuç riski yapay zekadan önce de endişe kaynağıydı
  • Bu taraf çok daha güvenli görünüyor
    https://www.inforum.com/newsmd/ndsu-students-book-scanner-in...
    http://diybookscanner.org

    • Bu yöntem kesinlikle daha güvenli, ama otomatik değil; birinin sayfaları çevirmesi gerekiyor
      Bu proje o sorunu çözmeye çalışıyor, fakat kitabı zedelememek için bunu çok daha nazik bir şekilde yapmalı
  • Tarandıktan sonra tüm içerik dijital biçimde olduğuna göre, taramadan önce kitabı tek tek sayfalara ayırarak cildini sökmenin neden ölçeklenebilir bir model olmadığını merak ediyorum
    Ek sökme işinden kaçınmak için mi

    • Arşivciler genellikle korumaya çalıştıkları eseri yok etmekten hoşlanmaz
      Bir kitabı taradığınızda elde ettiğiniz şey yalnızca optik görüntülerdir. Ortaçağ el yazmaları gibi durumlarda sayfalar silinip yeniden yazılmış olabilir
      Kitabı basitçe tarayıp fiziksel kopyayı yok ederseniz bu tür kanıtları kaybedersiniz
      Ancak ucuz kitlesel pazar kitapları söz konusuysa, çoğu arşivcinin de eseri korumak için milyonlarca nüshadan birini yok etmeyi pek önemseyeceğini sanmıyorum
      Gerçek sorun yalnızca çok eski ve çok nadir eserlerde ortaya çıkar
    • Kitap çok kıymetli değilse, genellikle giyotinle cilt kısmını tamamen kesip tek yaprak beslemeli tarayıcıya koymak daha kolaydır
  • Azıcık bile hasarlı olan kitapların hepsi paramparça olacak gibi

    • Bunu görünce ben de irkildim
      Dijitalleştirmek istediğim epey eski kitap var; yaygın kitap tarayıcılarının çoğu bile en azından kitabı tamamen açmayı gerektiriyor ve dediğin gibi bu kitabı yırtabilir
      Üstelik bu cihazlar vakum, keskin kenarlardan geçen hareket ve step motorları da içermiyor
      https://linearbookscanner.org/faq/ adresindeki ikinci soruya bakınca:

      Out of 50 books tested, 45% had one or two of their pages either torn or folded
      Bunu daha az değerli kitaplarımda bile kullanmazdım

    • Kesinlikle öyle olur. Bir şey takılırsa ya da ortam koşulları değişip kâğıtla etkileşirse, hasarlı olmayan kitaplar bile bu hale gelebilir
      Yine de taranması gereken dağ gibi kitap varsa ve böyle bir makineyle çoğunu halledip yalnızca özel durumları daha dikkatli ele alabiliyorsanız, bu bir kazançtır
  • Google, kabaca söylemek gerekirse, tüm kitapları zaten taramıştı. Sorun telif hakkı ve hak sahipleriydi
    Sayfa çevirme işi için düşük ücretli iş gücü kullandılar. Kimse önce bağlantıyı paylaşmazsa daha sonra bağlantıyı göndereceğim
    Eve dönünce baktım, yazı buymuş: https://www.theatlantic.com/technology/archive/2017/04/the-t...

  • Gerçekten harika görünüyor. Kitapları dijitalleştirmekle kalmıyor, üstüne bir de ücretsiz parçalıyor
    Epey iyi bir 1+1 anlaşma

  • Toz akarı alerjim var; kitaplar rafta yaklaşık 6 ay durunca sadece dokunmam bile alerjik reaksiyona yol açıyor
    Dışını silkelemek ya da elektrikli süpürgeyle çekmek işe yaramıyor
    Bu cihaz, kitapları okunabilir hale getirmek için içlerindeki toz akarlarını gidermede kullanılabilir gibi görünüyor