1 puan yazan GN⁺ 2023-12-23 | 1 yorum | WhatsApp'ta paylaş
  • Platformun tamamını ölçmeye yarayan bir payda yoksa, yanlış bilgi ya da önerilerin etkisi gibi araştırma sonuçları da bağlamını kolayca kaybedebilir; bu yüzden araştırma ekibi YouTube’un toplam ölçeğini rastgele bir örneklemle tahmin etmeye çalıştı
  • YouTube video ID’leri 11 karakterden oluşur ve olası adres uzayı 2^64 olduğundan, yalnızca rastgele URL denemesiyle geçerli bir video bulmak neredeyse imkânsızdır
  • Araştırma ekibi “drunk dialing” yöntemi ve verimlilik artırma teknikleriyle birkaç ay içinde 10 binden fazla gerçekten rastgele video topladı ve bugün YouTube’da yaklaşık 13,325 milyar video olduğunu tahmin ediyor
  • Örneklem analizi, yalnızca 2023’te 4 milyardan fazla videonun yüklendiğini ve medyan izlenme sayısının 39 olduğunu gösterdi; bu da YouTube’un uzun kuyruğunun çok büyük olduğunu ortaya koyuyor
  • Tubestats ölçek tahminini güncel tutmaya çalışıyor; ancak herkese açık olsa bile pratikte keşfedilmemiş video URL’lerini ifşa etmeme yönündeki etik sınırlamalar da sürüyor

YouTube araştırmasını zorlaştıran payda sorunu

  • Sosyal medya araştırmaları, yanlış bilgi veya nefret söylemi gibi göze çarpan olguları bulmaya odaklanmaya yatkındır; ancak bunların platformun tamamı içindeki payı bilinmezse ölçeğe dair değerlendirme sarsılır
    • Örneğin “white genocide” veya “ivermectin” gibi arama terimleriyle sonuç sayısını saymak mümkündür
    • Avaaz’ın Ağustos 2020 tarihli COVID yanlış bilgi raporu bir yıl içinde 3,8 milyar izlenme hesapladı; ancak toplam platform izlenmesi gibi bir payda yoksa bunun büyük mü küçük mü olduğunu değerlendirmek zordur
  • Reddit ve Twitter bir dönem platformun tamamını ölçmeye imkân veren veri erişimi sağlıyordu
    • Reddit, Pushshift’in tüm gönderileri toplamasına izin vererek topluluklar arası ölçek karşılaştırmasını mümkün kılmıştı
    • 2023 yazında Pushshift’e açık erişim engellenince Redditmap.social yalnızca o yılın başında oluşturulan verileri kullanabilir hâle geldi
    • Twitter, araştırma API’siyle tüm tweet’lerin onda biri ya da yüzde biri oranında örneklem sağlıyordu; daha sonra erişimi kapattı ve daha sınırlı erişim için yüksek ücretler koydu

YouTube’da temsili örneklem elde etmek zor

  • YouTube, neredeyse tüm internet kullanıcılarının kullandığı büyük bir platformdur
    • Pew’e göre gençlerin %93’ü YouTube kullanıyor
    • En yakın hizmetler TikTok %63 ve Snapchat %60
  • Belgelenmiş bir API olsa da YouTube’un tamamından rastgele temsili bir örneklem elde etmenin iyi bir yolu yok
  • Mevcut YouTube araştırmaları çoğunlukla iki yönteme dayanır
    • Seçilen kullanıcı kanallarındaki tüm videoları toplayıp analiz etmek
    • Belirli bir videodan başlayıp önerilen videoları izleyerek toplamak
  • Her iki yöntem de anlamlı araştırmalarda kullanılabilir; ancak YouTube videolarının tamamını temsil eden bir örneklem oluşturmak ya da platformun ölçeğini hesaplamak için yetersizdir

Rastgele URL denemeye dayalı “drunk dialing”

  • Jason Baumgartner, YouTube’un resmi olmayan API’si InnerTube’u kullanarak rastgele URL deneme yöntemini önerdi
  • YouTube URL’lerindeki video ID, watch?v= sonrasında gelen 11 karakterlik dizgedir
    • İlk 10 karakter a-z, A-Z, 0-9, _, - olabilir
    • Son karakter yalnızca 16 değerden biri olabilir
    • Olası YouTube adresi sayısı 2^64, yani yaklaşık 18,4 kentilyondur
  • YouTube’da 1 milyar video olduğu varsayılsa bile rastgele bir URL’nin geçerli olma olasılığı yaklaşık 18,4 milyarda 1 düzeyindedir
  • Araştırma ekibi bu yönteme “drunk dialing” adını verdi; Jason Baumgartner verimliliği yaklaşık 32.000 kat artıran bir dolaylı yol buldu
  • Kevin Zheng, bir keşif betiği yazarak birkaç ay içinde 10 binden fazla gerçekten rastgele YouTube videosu topladı

Rastgele örneklemle görülen YouTube ölçeği ve dağılımı

  • YouTube’un güncel ölçek tahmini 13,325 milyar video; bu tahmin tubestats.org üzerinde birkaç haftada bir güncelleniyor
  • Rastgele videoların yaşına bakarak YouTube’un büyüme hızını hesaplamak mümkün
    • Yalnızca 2023’te YouTube’a 4 milyardan fazla video yüklendiği tahmin ediliyor
  • İzlenme dağılımı güçlü bir uzun kuyruk gösteriyor
    • YouTube videolarının medyan izlenme sayısı 39
    • YouTube, 10 binin üzerinde izlenmiş videoları önermeyi seviyor
    • 10 binin üzerinde izlenmiş videolar veri kümesinin yaklaşık %4’ünü oluşturuyor, ancak YouTube’daki toplam izlenmelerin büyük bir bölümünü alıyor
  • Toplanan rastgele videolar dil dağılımını tahmin etmek için de kullanıldı
    • Kevin Zheng, arama betiğini çeşitli dil algılama sistemleriyle bağladı
    • Bu tahmin savunulabilir, ancak kusursuz değildir

Daha verimli dash method

  • Rastgele URL keşfi tüm adres uzayını hedeflediği için diğer örnekleme yöntemlerinin rastgeleliğini doğrulamada ölçüt olarak kullanılabilir
  • Araştırma ekibi, başka bir video listesi oluşturma yöntemi rastgele keşfe benzer sonuçlar veriyorsa bunun “makul ölçüde rastgele” sayılabileceğine karar verdi
  • Jia Zhou ve diğerlerinin 2011’de keşfettiği yöntem, daha verimli bir örneklem toplama yöntemi olarak çalışıyor
    • Bir karakteri tire olan 5 karakterlik bir dizge oluşturur
    • YouTube otomatik tamamlama ilgili URL’yi tamamlar ve varsa eşleşen videoyu döndürür
  • Kevin Zheng şu anda bu dash method ile YouTube’u düzenli olarak sorgulayarak Tubestats panosunu sürdürüyor

Uzun kuyruk videolar ve etik sınırlamalar

  • Rastgele örneklem, yalnızca başarılı influencer’ları değil, kullanıcı üretimi medyanın uzun kuyruğunun alt kısmındaki içerik üreticilerinin araçları nasıl kullandığını incelemek için de kullanılıyor
  • Toplanan videoların çoğu yalnızca birkaç düzine kişi tarafından izlenmiş videolar
    • URL’leri yayımlamak, “herkese açık” durumda olsalar bile pratikte pek görünür olmayan videoları kamusal incelemeye maruz bırakabilir
    • Bu yüzden makalede bulunan video URL’lerinin listesi yer almıyor
  • Ryan McGrady, 1.000 rastgele videoyu doğrudan izleyip elle kodlama çalışmasına liderlik etti
  • İlgili makale Journal of Quantitative Description’da yayımlandı; elle kodlama sonuçlarının tanıtımı ise Ryan’ın yazısında özetleniyor

Tubestats’i sürdürme nedeni

  • Araştırma ekibi Tubestats’i mümkün olduğunca sürdürmeyi planlıyor
  • YouTube’un bu kaynağa veya kaynağın oluşturulma yöntemine karşı çıkma olasılığı da var
  • Büyük kullanıcı üretimi medya platformları dijital kamusal alanın önemli bir parçası olduğundan, platformlarda ne olduğu, kimin ürettiği ve kime ulaştığına dair üst düzey veriler düzenli olarak kamuya açıklanmalıdır

1 yorum

 
GN⁺ 2023-12-23
Hacker News yorumları
  • Örneklem seçme yöntemi gerçekten çok zekice ve yazarlara alkışlar. Pew’deyken YouTube API’sinin "related videos" endpoint’ini takip eden bir rastgele yürüyüş ile YouTube’u haritalamaya çalışmıştık; yaklaşık 1 yıl sonra doyum noktasına ulaştığımızı sanmıştık ama burada çıkan ölçeğe bakınca, radarın altında kalan uzun kuyruğun epey uzun olduğu anlaşılıyor
    Araştırmayı yayımlar yayımlamaz Google neredeyse hemen API’yi kilitlemeye başladı, ama hâlâ eski usul scraping ile araştırmayı sürdüren insanlar olduğunu görmek sevindirici. O zamanki analiz kanal seviyesindeydi ve yalnızca popüler kanallara odaklanıyordu, ama TubeStats’taki bazı sayıların bizim bulduklarımıza oldukça benzemesi de ilginç. Örneğin dil dağılımı: https://www.pewresearch.org/internet/2019/07/25/a-week-in-th...

    • Google botlarının web’i durmadan tarayıp siteleri neredeyse ölümüne yoklamasını düşününce, Google’ın API’yi kilitlemesi oldukça ironik
    • Bu yöntemle, önerilerde bağlantılanmayan bazı herkese açık olmayan videolar gibi şeyler de bulunabilir
    • Bu teknik yeni değil. Biyologlar bunu göldeki balık sayısını tahmin etmek için kullanıyor
      100 balık yakalayıp işaretliyorsunuz, bir hafta bekliyorsunuz, sonra tekrar 100 balık yakalayıp bunların kaçının işaretli olduğunu sayıyorsunuz
    • Sanırım YouTube API’yi Cambridge Analytica skandalı sonrasında kapatmıştı
  • Bu, Alman tank problemi için geliştirilen karşı önlemi hedef alan ilginç bir yöntem https://en.m.wikipedia.org/wiki/German_tank_problem
    En iyi çözüm muhtemelen adres uzayını büyütmek olur; böylece rastgele örnekleme, istatistiksel olarak anlamlı bir sonuca varmaya yetecek kadar veri toplayamaz. Dağılımı farklı şekillerde değiştirmeye yönelik başka iyi çözümler de vardır ama örneklem gerçekten rastgeleyse, o yöndeki savunmalar sınırlı kalacaktır

    • Yazıda görmedim ama bu, ayrık düzgün dağılım varsayımına bağlı. Google’ın tanımlayıcılarla ne tür oyunlar oynadığını bilemeyiz
    • Rastgele örneklemenin kümelenmiş dağılım gibi bir şeyi nasıl çözeceğini anlamıyorum. Tahmin, süreklilik varsayımına dayanmıyor mu?
      Örneğin adresler /v=0x00 ile 0xff arasında olsun ama gerçekte yalnızca f0 ile ff kullanılıyor olsun; videoların rastgele dağıldığını varsayarsanız tahmin her zaman çarpık olmaz mı?
      Yani adreslenebilir uzaya keyfi bir filtre uygulayıp sonra adres atıyorsunuz. Aynı tür rastgele örnekleme aynı ölçüde şaşacaktır ama filtre olarak uyguladığım seyreklik bilinemez
  • "YouTube dislikes" veri setine de bakmaya değer: https://clickhouse.com/docs/en/getting-started/example-datas...
    Adının böyle olmasının sebebi, dislike özelliği kaldırılmadan önce bilgiyi toplamaya yönelik bir arşivleme çalışması olması. En tartışmalı videoları veya belirli bir dilde açıklaması olan en üst sıradaki videoları bulmak için kullanılabilir

    • YouTube o kadar büyük ve kamusal bir platform ki neredeyse bir kamusal altyapı sayılır; bu yüzden dislike sayıları gibi istatistikler önemlidir
      Yazıda da şöyle deniyor: “YouTube bu kaynağa ya da onu üretmek için kullanılan yöntemlere karşı çıkabilir. Buna karşı argümanım, bu tür üst düzey verilerin tüm büyük kullanıcı üretimi medya platformları için düzenli olarak yayımlanması gerektiğine inanmamdır. Bu platformlar dijital kamusal alanın en önemli parçalarıdır ve içlerinde ne bulunduğu, kim tarafından üretildiği ve kime ulaştığı konusunda çok daha fazla bilgiye ihtiyacımız var.”
      Devlet, platformların bu istatistikleri istatistik kurumlarının toplayabilmesi için açıklamasını zorunlu kılacak düzenlemeler yapmalı
    • Bu yorumu yazan kişi ClickHouse CEO’su
  • YouTube’un elindeki verinin ne kadar olduğunu merak ettim ama bu sayı yoktu. Verilen istatistiklerle kabaca hesaplayınca ortalama video uzunluğu yaklaşık 500 saniye çıkıyor.
    Bit hızını 400KB/s, video sayısını da 13 milyar alırsak 2,7 eksabayt ediyor. 400KB/s değeri, bizzat indirdiğim birkaç FHD 24~30fps videodan elde edildiği için çok kaba bir tahmin. YouTube muhtemelen algılanan bilgi miktarının düşük olduğu bölümleri daha düşük bit hızında kodluyordur; videoların çözünürlük ve kare hızı da birbirinden çok farklıdır ve bu dağılım servis tarihine göre değişir. Tüm videoların 1,5MB/s bit hızında 4K olduğunu varsayarsak 10 eksabayt eder.
    Bu tahmin, YouTube’un ihtiyaç duyduğu depolama alanını düşük hesaplıyor. Popüler videolar birden fazla veri merkezinde ve hem VP9 hem AV1 olarak saklanacaktır. Tersine, popüler olmayan videolar sıkıştırılıyor ya da başka bir biçimden isteğe bağlı olarak transcode ediliyorsa bu tahmin yüksek de olabilir, ama bu pek olası görünmüyor

    • Bu depolama tahmini muhtemelen tek haneli bir kat kadar sapmıştır.
      400KB/s, yani video kodlamada sık kullanılan 3,2Mbps, özgün kalite FHD yani 1080p yükleme için oldukça düşüktür. 4K video rakamı ise ortalama özgün yüklemeye epey yakındır.
      Buna ek olarak, YouTube’un en azından H.264 ve VP9 olmak üzere iki video codec’iyle sıkıştırma yaptığını da hesaba katmak gerekir. Her codec için, özgün yükleme kalitesine bağlı olarak 320p’den 1080p ve üstüne kadar tüm çözünürlükler vardır. Popüler videoların ve 4K videoların önemli bir kısmı AV1 ile de kodlanır. Bazılarında 360 derece surround videolar için HEVC bile vardır. Evet, doğru okudunuz. YouTube’da H.265 HEVC var.
      Üstelik bunların hiçbiri replikasyon ya da yinelenen depolamayı da içermiyor. Toplamın rahatlıkla 100EB’yi aşması şaşırtıcı olmaz. 2020’deki 100 Dropbox büyüklüğünde
    • Bir yandan da “yalnızca iki biçim mi?” denemez. H.264 gibi başka şeyler de var ve çözünürlükler de birden fazla olabilir. Ayrıca belirli bir çözünürlüğü belirli bir biçimde her zaman sunmaya dair sözleşmesel yükümlülükler olabilir ya da olmuş olabilir.
      Öte yandan görüntülenmesi inanılmaz derecede düşük çok fazla video da olabilir. Bir başka açıdan da, YouTube’un kendi transcode çiplerini bile yapmak zorunda kaldığını hatırlamak gerekir. Kelimenin tam anlamıyla karmaşık.
      10 yıl önce bu sorunun cevabını biliyordum ve depolama ekibinin maliyeti düşürmesine yardımcı oluyordum. Birkaç gün önce, o kişilerden biri olan R.L.’nin bu yılın şubat ayında vefat ettiğini öğrendim. RIP
    • Replikasyon ve silme kodlaması ek yükü atlanmış. 10 eksabayt dürüst olmak gerekirse çok düşük görünüyor. Şu anda 50~100EB’ye daha yakın olduğunu tahmin ederdim
    • 2013’te, dakikada yüklenen saat miktarına dair yıllık rapor sayılarına dayanarak hesapladığımda içerik 375PB idi; günde 185TB artıyor ve yıllık büyüme oranı %70’ti.
      Bu hesapta birden fazla kodlanmış kopya ya da özgün dosyaların saklanması yer almıyordu
    • YouTube’un özgün yükleme kopyalarını kalıcı olarak sakladığını da hesaba katmak gerekir. Özgün dosya daha büyük olabilir
  • Bu yazının bir çıktısı olarak bağlantılı bir site var: https://tubestats.org/

  • Google eskiden bazı pozisyon mülakatlarında YouTube ile ilgili ölçeklenebilirlik soruları sorardı. Genelde büyüyen dağıtık altyapılarda log verisini senkronize etme problemine uzanırdı ve neredeyse sözle anlatması bile zor, saçma Big-O(f(n)) benzeri sonuçlar çıkardı.
    Kaynak: Google’da birkaç kez mülakata girdim

  • Yazar “cheats” kullandığını yazmış. Bunun ne yaptığına bağlı olarak, örneklerin bağımsız olduğu iid varsayımı bozulabilir.
    Kartopu örneklemesine benziyorsa “aşırı” başarı oranı üretip sayıları şişirebilir. “Jason bu yöntemi yaklaşık 32.000 kat daha verimli hale getiren birkaç hile buldu, böylece ‘aramamız’ çok daha sık bağlanıyor” diye bir ifade var.

    • Yazıyı sonuna kadar okumak yeterli.
      “Bunu 2011’de Jia Zhou ve diğerleri keşfetti; bizim naif yöntemimizden çok daha verimli. Bir karakteri tire olan beş karakterlik dizeler üretirseniz YouTube bu URL’yi otomatik tamamlar ve varsa eşleşen videoyu getirir” deniyor
    • URL’de muhtemelen bir checksum var; böylece gerçek videoya erişmeden de yazım hatası tespit edilebiliyor olabilir.
      Checksum’un nasıl üretildiğini bilmeseniz bile, gerçek ID uzayından aldığınız bir örnek için o değerin tüm olasılıklarını deneyebilirsiniz
    • O hile muhtemelen video varlığını tekil sonuç olarak döndüren playlist API benzeri bir şey kullanıyordur.
      Örneğin x, x+1, x+2, ... kimliklerini içeren bir oynatma listesi oluşturma API çağrısı yapıp sonra listeyi alırsınız; sonuçta yalnızca atanmış kimlik olan x+2 görünür
    • Örnek çarpıtılmış olsaydı veriler muhtemelen bu kadar temiz görünmezdi. Google ilginç bir şey yaptıysa, az miktarda bir çarpılmayla sınırlı kalmamış olması beklenirdi
    • Katılıyorum.
      Benim gibi istatistikte acemi biri için, hileler ve otomatik tamamlama kullanılsa bile örnek bağımsızlığının bozulmadığı ve olabildiğince rastgele örneklemenin korunduğu yönünde bir kanıt gerekir.
      Sarhoş halde rastgele numara çevirirken, her seferinde bir insan operatör gibi yanlış bastığınız numaraları düzeltip birileriyle bağlanmanızı sağlıyorsa bu rastgele görünmez.
      Yine de 85 sayfalık makaleyi okumadım. Belki orada ele alınmıştır
  • İlginç bir veri kümesi. Makale kanal istatistikleri hakkında biraz yanıltıcı bir izlenim bırakıyor.
    Benim anladığım kadarıyla abone sayılarına bakarken örnekleme eğilimini düzeltmek için yeniden ağırlıklandırma yapılmıyor. Örnek tüm evrenin küçük bir parçasıysa, belirli bir kanalın görünme olasılığı o kanalın herkese açık video sayısıyla orantılıdır; dolayısıyla kabaca kanal başına video sayısının 1’iyle ağırlıklandırmak gerekir

    • Ben de bunu fark ettim. 1 milyon abonenin 98. persentil olması pek inandırıcı görünmüyor; 99,999 persentil olmaması düşük olasılık gibi duruyor
  • Merak edenler için açıklayayım, bunların tahmin yöntemi kabaca şöyle:
    Bir değer aralığı varsayıyorlar ve o aralıktan örnek çeken adil bir olasılık fonksiyonu olduğunu kabul ediyorlar. Tahmini büyüklük, isabet oranının tüm değer aralığıyla çarpılmasıyla elde ediliyor

    • Yazıya göz gezdirdim; öyleyse varsayım sayısı epey fazla.
      Olası değer aralığının doğru olduğunu varsayalım. Belirli bir aralıktaki 10 karaktere 1 eklenmiş biçimdeyse, videoların bulunabileceği devasa bir çemberi temsil eder.
      Belirleyici olan, yani geçerli videoların dağılımıdır. YouTube’un kimliklere bizim bilmediğimiz kısıtlar ya da çarpıtmalar uygulamış olması halinde, gerçekten var olan video kimlikleri bu büyük olasılık çemberinin içinde daha küçük bir çember olabilir ve tüm alana eşit dağılmıyor olabilir. Kümelenme de olabilir. O durumda önce o çarpıtmanın siluetini elde etmek ya da kabaca rastgele olup olmadığını görmek için, örneğin uzaya Poisson dağılımıyla dart atar gibi örnekleme yapmanız gerekir.
      Ancak ondan sonra büyüklük tahmin edilebilir. Yaptıkları şey bu mu? Ve neden biri çıkıp doğrudan YouTube’a sormamış?
  • Bu yöntemi engellemek gerçekten çok kolay. Var olmayan tanımlayıcıların belli bir oranı için rastgele videolar döndürmek yeterli olur. Buna biraz da rastgelelik katınca tamamdır
    Yöntemi açıklamanın beraberinde getirdiği risk tam olarak bu

    • O zaman bunu, sistem genelindeki birçok değişmez koşulu bozmadan uygulamak çok zor görünür
      Örneğin video kimliğinin değişmez olması ve bir videonun yalnızca tek bir benzersiz video kimliğiyle temsil edilmesi gibi koşullar
    • Rastgele üretilmiş bir kimlikten video çıktıysa, hemen tekrar sorgulayıp öncekiyle aynı video mu diye bakmak yeterli
      Aynı değilse o sonucu atar ve üretilen kimliğin aslında var olmadığını kabul edersin. Aynıysa bunun gerçek bir kimlik olduğunu anlarsın
      YouTube video URL'leri değişmez olduğu sürece bu yöntem, yukarıda sözü edilen engellemeyi aşabilir
    • Ancak YouTube bunu yaptığını açıklamazsa, yöntemin etkisiz hale getirilip getirilmediğini bilemeyiz. Üstelik o diğer videonun da kendine ait mevcut bir UID'si olacağından, teorik olarak bunun bu tür ölçümleri bozmak için kopyalanıp kopyalanmadığını da bilemeyiz
    • Böyle bir sistemde production hatalarını debug etmeyi hayal etmek bile zor
    • Video kimlikleri kullanılabilir alan içinde sıralı mı, yoksa tamamen dağınık mı? Bilinen, aktif video kimliklerinin ortak bazı özellikleri var mı; yani quintillion ölçeğindeki olasılıkları taramayı kolaylaştıracak bir şey?