1 puan yazan GN⁺ 2024-02-07 | 1 yorum | WhatsApp'ta paylaş
  • Sözleşme incelemesinde LLM'leri Junior Lawyer ve yasal süreç dış kaynak kullanımı (LPO) ile karşılaştıran bu deneyde, Senior Lawyer değerlendirmeleri doğru cevap ölçütü olarak alındı; hukuki mesele tespiti, konum belirleme, hız ve maliyet birlikte değerlendirildi
  • Hukuki mesele tespitinde GPT4-1106, 0.871 F-score ile LPO'nun 0.874 sonucuna çok yaklaştı ve Junior Lawyer'ın 0.860 sonucunu geçti; ancak konum belirlemede LPO 0.770 ile GPT4-32k'nın 0.740 sonucunun önünde yer aldı
  • Deneyde anonimleştirilmiş 10 tedarik sözleşmesi kullanıldı; NDA'ler belgelerin kısa olması nedeniyle karmaşık değerlendirme için uygun görülmediğinden dışarıda bırakıldı ve ABD ile Yeni Zelanda yargı alanlarındaki sözleşmelere dengeli biçimde yer verildi
  • İnceleme hızında LLM'ler açık ara öndeydi; ortalama süreler Junior Lawyer için 56.17 dakika, LPO için 201 dakika iken GPT4-1106 için 4.70 dakika, GPT4-32k için 2.11 dakika, Palm2 text-bison için 0.73 dakika düzeyindeydi
  • Sözleşme başına maliyet Claude 2.0 ve Claude 2.1 için 0.02 dolar, GPT4-1106 için 0.25 dolar olarak hesaplandı; bu da Junior Lawyer'ın 74.26 dolar ve LPO'nun 36.85 dolarlık maliyetine kıyasla en fazla %99.97 maliyet tasarrufu anlamına geliyor

Sözleşme incelemesinde ne karşılaştırıldı

  • Amaç, LLM'lerin yüksek hacimli sözleşme inceleme işlerinde doğruluk, hız ve maliyet verimliliği açısından Junior Lawyer ve LPO'yu geçip geçmediğini ya da onlarla aynı seviyede olup olmadığını değerlendirmekti
  • Karşılaştırılan görev, sözleşme içindeki hukuki meseleleri tespit etmek ve bu kararı etkileyen sözleşme hükümlerinin konumunu bulmaktı
  • Senior Lawyer tarafından yapılan değerlendirmeler doğru cevap ölçütü olarak alınarak LLM, Junior Lawyer ve LPO sonuçları karşılaştırıldı
  • Araştırma soruları üç başlıkta toplandı
    • LLM'ler, sözleşme içindeki hukuki mesele tespiti ve konum belirlemede Junior Lawyer ve LPO'dan daha iyi mi
    • LLM'ler sözleşmeleri daha hızlı inceleyebilir mi
    • LLM'ler sözleşmeleri daha düşük maliyetle inceleyebilir mi

Veri kümesi ve deney tasarımı

  • Veri kümesi, gerçek hukuki sözleşmelerden alınan anonimleştirilmiş 10 tedarik sözleşmesinden oluştu
  • Tedarik sözleşmeleri, hukuk pratiğinde inceleme hacmi yüksek bir sözleşme türü olduğu için seçildi; NDA'lerin ise genellikle kısa olması nedeniyle LLM'lerin karmaşık hukuki mesele tespit yeteneğini değerlendirmek için yeterli olmadığı düşünüldü
  • Yargı alanları olarak ABD ve Yeni Zelanda sözleşmelerine dengeli biçimde yer verildi
    • ABD, yazılı hukuk ile common law'un birleştiği bir sistem olarak ele alındı
    • Yeni Zelanda, common law temelli bir sistem olarak ele alındı
  • Her sözleşme, belge senaryosu ve sözleşme inceleme playbook'undan oluşan iki bileşenli yapı ile analiz edildi
    • Belge senaryosu; yargı alanı, geçmiş, kuruluş ölçeği ve sözleşme taraflarının ürün/hizmet bağlamını sağladı
    • İnceleme playbook'u, gerçek vakalardan türetilmiş standart kontrol maddeleri sundu
  • Senior Lawyer, her sözleşmenin önceden tanımlı ölçütleri karşılayıp karşılamadığını değerlendirdi ve bu kararı etkileyen belirli sözleşme bölümlerini bulup kaydetti
    • İlgili bilginin sözleşmede bulunmaması nedeniyle ölçütün karşılanmadığı durumlar da açıkça kaydedildi
    • Birden fazla Senior Lawyer'ın sonuçları çoğunluk görüşüne göre toplulaştırıldı
  • Araştırma, Onit Inc.'in etik standartlarına göre yürütüldü; katılımcı bilgilendirmesi, çekilme hakkı, anonimleştirme, sözleşme verilerinin kimliksizleştirilmesi, etik kurul katılımı ve denetimi gibi unsurları içerdi

Model seçimi ve prompt'lar

  • Modeller, LLM alanındaki başlıca sağlayıcılar, ön test sonuçları ve context window büyüklüğü dikkate alınarak seçildi
  • 16.000 token'dan fazlasını işleyemeyen modeller, sözleşmenin tüm bağlamını ele almakta zorlanacakları düşünülerek değerlendirme dışında bırakıldı
    • LLaMA2 ve Amazon Titan için belgeyi birden fazla parçaya bölmek gerekiyordu; her parçada senaryo, playbook ve tanım maddelerinin yeniden verilmesi gerekiyordu
    • RAG gibi teknikler de incelendi ancak ön değerlendirmede sözleşme bağlamı anlayışında kopukluk yarattığı için insan avukat seviyesindeki anlayışla karşılaştırmaya uygun bulunmadı
  • Değerlendirmeye dahil edilen modeller ve ayarları şöyleydi
    • GPT4 32k: temperature 0.2, giriş 32,768 token, eğitim verisi Eylül 2021'e kadar
    • GPT4-1106: temperature 0.2, giriş 128,000 token, eğitim verisi Nisan 2023'e kadar
    • GPT3.5-turbo-16k: temperature 0.2, giriş 16,385 token, eğitim verisi Eylül 2021'e kadar
    • Claude 2.1: temperature 0.2, giriş 200,000 token, eğitim verisi 2023 başına kadar
    • Claude 2.0: temperature 0.2, giriş 100,000 token, eğitim verisi 2023 başına kadar
    • Palm2 Text-bison-32k-2: temperature 0.2, giriş 32,768 token, eğitim verisi 2021 ortalarına kadar
  • Prompt'lar rol, görev ve bağlamdan oluşuyordu
    • Rol, modelin avukat personasını izlemesini sağlıyordu
    • Görev, verilen ölçütlere göre sözleşmeyi incelemek ve mesele ile konum hakkında karar vermekti
    • Bağlam, hedef okuyucu, taraf geçmişi ve müzakere senaryosu gibi unsurlarla; avukatlara, LPO'lara ve sözleşme inceleyicilerine verilen talimatlara benzer şekilde kurgulandı

Doğruluk: mesele tespiti yakın, konum belirlemede fark var

  • Hukuk profesyoneli grupları arasındaki uyum Cronbach’s Alpha ile değerlendirildi
    • Tüm katılımcılar arasındaki uyum 0.923366 ile yüksekti
    • Senior Lawyer'lar arasındaki uyum 0.719308 ile en düşüktü
    • Junior Lawyer için bu değer 0.765058 idi
    • LPO, 1.0 ile tam yanıt uyumu gösterdi
  • Hukuki mesele tespitinde F-score bazında en iyi sonuçlar LPO ve GPT4-1106'dan geldi
    • LPO: precision 0.933, recall 0.823, F-score 0.874
    • GPT4-1106: precision 0.835, recall 0.910, F-score 0.871
    • Junior Lawyer: precision 0.876, recall 0.845, F-score 0.860
    • Claude 2.0 ve GPT4-32k sırasıyla 0.817 ve 0.820 F-score elde etti
    • GPT3.5 0.657, Palm2 text-bison ise 0.708 ile daha düşük kaldı
  • Mesele konumu belirlemende en yüksek F-score'u LPO elde etti
    • LPO: precision 0.915, recall 0.666, F-score 0.770
    • GPT4-32k: precision 0.847, recall 0.660, F-score 0.740
    • Claude 2.1: precision 0.911, recall 0.569, F-score 0.701
    • GPT4-1106: precision 0.857, recall 0.575, F-score 0.686
    • Junior Lawyer: precision 0.866, recall 0.542, F-score 0.667
    • Palm2 text-bison, 0.452 F-score ile en düşük sonucu verdi
  • LLM'ler mesele tespitinde Junior Lawyer ve LPO ile benzer ya da daha iyi olabilir; ancak hüküm konumunu isabetli biçimde işaretleme işinde modeller arasında büyük fark var ve her zaman insan profesyonellerin önüne geçemiyorlar

Hız, maliyet ve devreye alma kısıtları

  • Ortalama sözleşme inceleme süresi, LLM'lerde insan profesyonellere kıyasla çok daha kısaydı
    • Senior Lawyer: 43.46 dakika
    • Junior Lawyer: 56.17 dakika
    • LPO: 201.00 dakika
    • GPT4-1106: 4.70 dakika
    • GPT4-32k: 2.11 dakika
    • GPT3.5: 1.44 dakika
    • Claude 2.1: 2.05 dakika
    • Claude 2.0: 1.63 dakika
    • Palm2 text-bison: 0.73 dakika
  • En hızlı LLM olan Palm2 text-bison'ın sözleşme inceleme görevini LPO'dan 276 kat, Junior Lawyer'dan 77 kat daha hızlı tamamladığı hesaplandı
  • LLM sistem prompt'unun kurulumu, testi, ince ayarı ve doğrulanması ortalama 16 saat sürdü; bu süre, Junior Lawyer ve LPO'ya benzer işleri tarif etmek için harcanan zamana yakın düzeydeydi
  • Sözleşme başına ortalama maliyet, insan profesyoneller ile LLM'ler arasında büyük fark gösterdi
    • Senior Lawyer: 75.92 dolar
    • Junior Lawyer: 74.26 dolar
    • LPO: 36.85 dolar
    • GPT4-1106: 0.25 dolar
    • GPT4-32k: 1.24 dolar
    • GPT3.5: 0.05 dolar
    • Claude 2.1: 0.02 dolar
    • Claude 2.0: 0.02 dolar
    • Palm2 text-bison: 0.03 dolar
  • Maliyet hesabı, insan profesyoneller için ortalama süre ve saatlik ücret; LLM'ler içinse ortalama giriş/çıkış token sayısı ve token başına fiyat temel alınarak yapıldı
    • Palm2 text-bison için hesaplama token yerine karakter sayısı üzerinden yapıldı
  • Mesele konumu belirlemede zayıf kalan LLM'ler, sözleşmeleri tek başına markup'lamakta sınırlı kalabilir; bu nedenle hukuk işlerinde model seçimi, performans ve maliyet kadar önemli

1 yorum

 
GN⁺ 2024-02-07
Hacker News görüşleri
  • Avukatların hazırladığı sözleşmeleri şablonlara dönüştüren bir hukuki sözleşme oluşturma girişimi işletiyorum ve sıradan insanların sözleşmeleri okuyup soru sorabilmesi için kısmen GPT analiz özellikleri de geliştirdim
    Sözleşme incelemesinde GPT, belge üretmekten çok belge analizi konusunda daha güçlüydü ve bu makale de bunu destekliyor. Ancak çeşitli yapay zeka belge inceleme girişimlerini kullandığınızda, belirli cevapları didiklemeye başladığınız anda çoğu dağılıyordu. Bu makalede ise avukatla müvekkilin karşılıklı konuşması gibi bir durumdan ziyade, ilgili maddeleri bulma düzeyinde kalınmış gibi görünüyor
    GPT yanlış cevap verse de hukuki sorumluluk taşımıyor; bu yüzden akıllı birinin kendi başına araştırma yaparken kullanması açısından faydalı. Eskiden de akıllı insanlar Google ile kendi araştırmasını yapabiliyordu, buna benziyor
    Sözleşme oluşturma konusunda ise çoğu durumda GPT'nin her seferinde sıfırdan benzersiz bir sözleşme üretmesindense, iyi yazılmış ve gözden geçirilmiş standart sözleşme deposunun daha faydalı olacağını düşünüyorum. Avukatlar sözleşmeleri sıkı sıkıya elinde tutuyor ve bizim şablonlaştıracağımız sözleşmeleri yazacak avukat bulma süreci de çok zordu. Sonuçta bu, kendilerinin ve mesleki topluluklarının gelecekteki gelir kaynaklarını azaltan bir iş. GPT-4'ü eğitmek yüz milyonlarca dolara mal oldu ama 10 milyon dolar harcanıp iyi incelenmiş bir sözleşme deposu oluşturulsaydı, aynı parayla sözleşme üretim modeli eğitmekten daha faydalı olurdu
    İnsanlar belgelerle yapmak istedikleri şeyler hakkında oldukça çeşitli sorular soruyor ve GPT bunlarda henüz iyi değildi. Yakın gelecekte avukatlık işleri hâlâ varlığını sürdürecek gibi görünüyor

    • Avukatların sözleşmeleri elden bırakmama eğilimi başka uzmanlık alanlarında da görülüyor ve özellikle eğitim için büyük ön yatırım gerektiren alanlarda daha belirgin
      Örneğin yaklaşık 20 yıl önce, en azından yaşadığım yerde, mimarlar da birçok kişiye ucuza satılabilecek tasarımlar yapmak istemiyordu. Çünkü bunun mimari çıktı pazarını küçülteceğini düşünüyorlardı. Ama çoğu insanın gerçekten benzersiz bir tasarıma ihtiyaç duymadığı da açık
      Sonunda piyasa bunu pek umursamadı ve biri kullanılabilir bir tasarım kütüphanesi ile iş modeli kurabildiğinde sorun kendiliğinden çözüldü. Mimarların önünde ya iş birliği yapıp en azından bir kısmını kurtarmak ya da kaybetmek seçenekleri kaldı
      Avukatların da aynı yoldan gideceğini düşünüyorum. En kolay ve en kârlı işler otomatikleştikçe zor bir dönem geçirecekler, hukuki hizmet pazarı küçülecek ve geriye otomasyonun halledemediği daha karmaşık işler kalacak
    • Kısa süre önce Willful ile vasiyetname hazırladım ama sonuç oldukça hayal kırıklığı yarattı. Şablonlar aşırı katıydı; “X olursa Y, olmazsa Z” gibi gayet ifade edilebilir olması gereken koşullar bile zordu ve mal varlığı dağıtımında da toplam içindeki oran dışında bir şeye izin verilmiyordu
      Evcil hayvanların durumu gibi çok da önemli hissettirmeyen konulara ise gereğinden fazla ağırlık verilmiş gibiydi. Ortaya çıkan metni kendime göre yeniden düzenleyebildim ama 150 dolarlık bir hizmet için daha fazlasını beklerdim
    • LLM'lerin kod üretirken de genel olarak benzer olduğunu düşünüyorum. Bir başlangıç noktası olarak yararlı ama ötesi değil. Bir süre daha biz programcılara da iş var
    • Yapay zeka sözleşme inceleme araçlarının belirli cevaplar istendiğinde dağılmasının nedeni, aslında nihai incelemeyi Utah'taki gerçek bir avukata “outsource” etmeleri olabilir
      Aklımdaki şirket pazarlama materyallerinde bunu tamamen yapay zeka tabanlı bir çözüm gibi ima ediyor ama gerçekte yalnızca yapay zekayla çalışmıyor gibi görünüyor
    • GPT yanlış cevap verse de hukuki sorumluluğu olmadığı söylenmişti ama benim anladığım kadarıyla avukatlar da yanlış cevap verdikleri için hukuki sorumluluk altına girmiyor
      Uç durumlarda bu etik bir meseleye dönüşüp baro yaptırımı olabilir ama çoğu durumda sonuç yalnızca itibarla ilgili değil mi? Hatalı hazırlanmış bir sözleşme için avukatın hukuken sorumlu tutulabileceği durumlar var mı?
  • LLM'lerin yardımcı olabileceği alanlar içinde hukuk alanı özellikle umut verici görünüyor. 5-10 yıl içinde, hatta bu makaleye bakınca neredeyse şimdiden gelmiş gibi, vergi, sağlık, sigorta ve evlilikle ilgili belgelerime erişebilen bir “avukat” LLM ile saat başına 500 dolar ödemeden birkaç saat konuşup kişiselleştirilmiş tavsiye ve bilgi alabileceğimi düşünüyorum
    Hukuk konusunda daha bilgili sıradan insanlardan oluşan bir dalga gelecek ve bu gerçekten heyecan verici

    • LLM'nin söylediği her şeye körü körüne güvenmem ama genel olarak doğru olur ve en azından daha fazla araştırabileceğim keşif amaçlı kelime dağarcığı sağlar. Ya da soru sormaya devam ederek daha derine inebilirim
      Yazılım lisansları ve hukuki sonuçları hakkında LLM'lere şimdiden sorular sordum ve hobi projesi seviyesindeki sorularda pahalı bir uzmana gitmeden önce temel bir çerçeve oluşturabildim
      Elbette kararın içinde büyük para varsa profesyonel hizmet alırım. Bu tür konularda “genel olarak doğru” yeterli değildir
    • Tam da şu anda böyle bir şey inşa ediyoruz
      Ana işimiz hukuki belge oluşturma ve bu, yapay zekayla değil kural tabanlı mantıkla çalışıyor. Ana işimizin sonucu olarak kullanıcıların hukuki belgelerini zaten elimizde bulundurduğumuz için, bu belgelerle ilgili yardımcı bir yapay zeka sohbet özelliği geliştirmek için çok iyi bir konumdayız
      Yakın zamanda ürün önerisi yapan bir yapay zekayı canlı ortama aldık. Bir kısmı kural tabanlı, kişiselleştirilmiş öneri metinlerini ise GPT-4 üretiyor. Şu anda kullanıcıların çeşitli hukuki belgeleri ve hizmetimizi anlamasına yardımcı olacak bir yapay zeka sohbet özelliği geliştiriyoruz. Birinci seviye müşteri desteğini bu yapay zeka sohbetiyle değiştirmeyi planlıyoruz; ancak kızmadan önce mevcut birinci seviye müşteri desteğimizin zaten çok kötü bir kural tabanlı yapay zeka olduğunu bilin
      Fince ana web sitemiz https://aatos.app. SE ve DK için bazı hizmetlerimiz de var, yakın zamanda da Birleşik Krallık'ta önce yalnızca e-imza hizmetini açtık
    • Harcamaları azaltan bir LLM de mümkün görünüyor. Tüm tüketim kalemlerini tarayan, güncel yasaları, avantajları, dernekleri ve promosyonları bilen; elektrik tedarikçisini ya da sigorta şirketini değiştirmeyi veya başka bir mağazadan toplu alım yapmayı öneren ya da bizzat yapan bir LLM hayal edebiliyorum
    • Bu yalnızca hukuka özgü bir mesele değil. Kan tahlili sonuçlarımı ve 23andMe verilerimi ChatGPT'ye yükledim, doktorumdan daha iyi analiz etti
    • Birçok girişimin tam olarak bunu yapmaya çalıştığını düşünüyorum ama açıkçası çok umutlu değilim. Herkes hâlâ token sınırlarına takılıyor ve bunu aşmanın başlıca yöntemleri olan retrieval-augmented generation (RAG) ile bilgi grafikleri, istenen görünüme yaklaşabiliyor olsa da gerçekten yararlı olacak kadar yaklaşmış değiller diye düşünüyorum
  • LLM’lerin hukuk alanına uygulanma olasılığına dair değerlendirmeyi, belge ve sözleşme incelemesi dışındaki görevlerde test edilene kadar erteleyeceğim. Büyük şirket hukukunda sözleşme incelemesi çoğu zaman yeni mezun yüzlerce kişiye dış kaynak olarak veriliyor; gerçek avukat becerisini en alt düzeyde kullanan, daha çok düzeltme işine yakın bir süreç ve şirket kârlılığını artırmaya yarıyor
    Bireylerin çoğunlukla satın aldığı hukuki hizmetler aile hukuku davaları, ceza davaları ve küçük meblağlı davalar gibi alanlar. Ağır ceza yargılamalarında gereken olguya ve bağlama özgü analizleri yakın gelecekteki LLM’lerin kaldırabileceğini sanmıyorum. Velayet davalarında ya da çekişmeli boşanmalarda gereken bireysel, olaya özgü ve düğümlenmiş aile dinamiklerine LLM’lerin yaklaşabildiğini gösteren bir şey de görmedim
    LLM’leri avukatların kullandığı bir araç olarak benimsememek için bir neden yok, ancak tekrarlayan hukuki redaksiyon işlerinin ötesine geçip gerçek pratiğe alınmaya hazır bir teknoloji olduğunu hiç düşünmüyorum

    • İnsanlar da velayet ya da boşanma gibi karmaşık aile dinamiklerini ele almakta pek iyi değil. Sonuçlara bakınca, yargıcın kişisel bakış açısı ve duyguları bu tür davalarda büyük ağırlık taşıyor gibi görünüyor
      Duygular, kişisel bakış açıları ve bunların üzerine birikmiş içtihatlar olmasa bu davaların nasıl görüneceğini pek bilmiyorum
  • Teknoloji tabanlı ticari sigorta aracılık şirketinde veri ve AI tarafını yönetiyorum. GPT-4 kullanarak sigorta gerekliliklerine özel bir derin sözleşme analizi aracı geliştiriyoruz; Google’da çalışırken de patent sınıflandırmadan delil keşfi desteğine kadar Google hukuk ekibi için çeşitli LLM çözümleri yapmıştım
    Dil modelleri hukuki metinleri sindirme ve bağlamı analiz etme konusunda çok iyi. Ancak birçok hukuki uygulama, “mevcut sigorta programı kapsamında sözleşmesel olarak teminat altında mı?” gibi hata kabul etmeyen kritik kararlarla bağlantılı. Bu yüzden hukuk alanındaki LLM ürünlerini şu ilkelerle geliştiriyoruz
    Uzmanla birlikte kullanılan bir human-in-the-loop aracı olmalı. Mümkün olduğunda otomasyon yerine karar desteği olarak tasarlanmalı; buna rağmen çok büyük zaman tasarrufu sağlayabiliyor
    Şeffaflık ve alıntı gerekli. İnsanla birlikte kullanılan bir araçta güven oluşturacak mekanizmalar olmalı. İster LLM’in başvurduğu belge maddelerini vurgulasın, ister analizin bir bölümünün neden sunulmadığını açıklasın, dayanak göstermek önemli
    Geri çağırımdan çok kesinliğe göre ayarlanmalı. Birçok hukuki kullanım senaryosunda yanlış pozitifler ve halüsinasyonlar özellikle kötü olduğundan, modeli ya da prompt’u kesinlik odaklı ayarlamak bunları azaltmaya yardımcı oluyor

    • GPT-4’e atıf yaptırmanın bir yoluna dair ipucu var mı? “Alıntıladığın pasajı aynen tekrar alıntıla” gibi bir prompt kullanıp sonra metindeki yerini bulup vurgulamak gibi mi?
      “Kesinliğe göre ayarlamak” derken prompt engineering’i mi kastediyorsun, yoksa gerçekten GPT-4’ü ince ayar yapmaktan mı söz ediyorsun?
  • Bu makale tamamen değersiz değil ama sanki bütün bir meslek grubuna ya da “endüstriye” dair abartılı cümleler kurmak için bahane gibi duruyor. Muhtemelen görünürlük kazanmak ve ileride bir şeyler satmak gibi bir amacı da olabilir
    En kötü tarafı, önceki çalışma olarak yalnızca tek bir preprint belgeye atıf yapması. O belge de sözleşme incelemesiyle değil, genel hukuki akıl yürütmeyle ilgili. LegalBench’in bazı kısımları elbette “yorumlama” içeriyor ve mevcut sözleşme inceleme benchmark’larının üzerine kurulmuş, ama daha ilgili makaleler bulunabilirdi
    Hukuki belge inceleme otomasyonu, soru-cevap görevleri de dahil olmak üzere yaklaşık 20 yıldır doğal dil işlemede çok aktif bir alan ve 2017’den sonra daha da hareketlendi. En azından Kira ve Luminance gibi araçlar LLM tabanlı olmasalar da dünya çapında hukuk ekipleri ve hukuk bürolarında oldukça yaygın kullanılıyor. Bu yüzden avukatlar sınırlamalarını pratikte zaten biliyor
    Yine de Kira benzeri araçlar en yeni model performansını ölçmüyor ve şeffaf benchmark’lar da kullanmıyor. Bu açıdan bu makalenin benchmark sonuçları, LLM kullanımı bakımından memnuniyet verici bir ek veri noktası
    Ama tek bir inceleme playbook’u ile 10 belgeyi inceleyen bu sınırlı kapsam düşünüldüğünde, “endüstriye etkileri”ne kadar uzanmak gereksizdi. Biraz gösteriş kokuyor ve hukuk hizmetleri endüstrisinin geleceğinden çok, yazarların o endüstriyi iyi tanımadığını gösteriyor
    Yetenekler ve sınırlamalar ilgini çekiyorsa, hafif ama faydalı okumalar olarak şunları da öneririm: https://kirasystems.com/science/, https://zuva.ai/blog/, https://www.atticusprojectai.org/cuad

    • Özellikle önerebileceğin belirli makaleler var mı? Linkler, çok sayıda makale içeren bloglara gidiyor
  • Avukatların, kendi endüstrilerini tehdit eden bir teknolojiyi zayıflatmak için ne tür hukuki argümanlar üreteceğini merak ediyorum

    • Tersine, avukat olmanın maliyeti daha da artacak gibi geliyor. Çünkü artık AI akıl yürütmesini çalıştıracak sunuculara, geliştiricilere ve üçüncü taraf hizmetlere ihtiyaç olacak
    • En azından ABD’de avukatlar devleti ele geçirmiş durumda. Yakında hukuk alanında AI kullanımını yasaklayan ya da ağır biçimde sınırlayan yasalar çıkmasını bekliyorum
      Gerekçeler etkisiz savunma riskinden “çocukları düşünün”e kadar değişir. Tekeli korumaya yarayan ne varsa kullanırlar
    • Bu zorlama bir argüman değil, buna yetkisiz hukuk hizmeti sunma deniyor ve suç
    • Ana saldırı hattı telif hakkı gibi görünüyor
  • Avukatların ChatGPT ile araştırma yapıp dava dilekçesi hazırlamaya yardım aldıktan sonra işlerin kötü gittiği yakın tarihli vakalara bakınca, buradaki yorumlardaki iyimserliğe tamamen ikna olmuş değilim

    • Teknoloji fena değil. Sıradan teknik olmayan kullanıcıların onun kusurlarını ve sınırlarını anlamasına yönelik eğitim ve okuryazarlık ise ayrı bir mesele
    • Hepsi GPT-4 ücretini bile ödememeye çalışan aptallardı. Halüsinasyona kapıldılar
    • Bu acemice bir hataydı. İçtihadın gerçekten var olup olmadığını kontrol etmemişler
      üretim→doğrulama şeklinde küçük bir boru hattı kurmak önemsiz bir iş değil ama imkânsız da değil. Bahsedilen vakalar, aşırı tembel bir associate ile LLM’in ne yaptığını çok kötü anlayan birinin birleşimi gibi görünüyor
  • Teorik olarak hukuk dili, kod gibi yapılandırılmış olmalı. Mantıksal bir yapısı olduğu için diğer doğal dillere kıyasla LLM’lere daha kolay uygulanabilir
    Avukatların “uydurma” içtihatlar sunduğuna dair ilk haberler vardı ama hukuk mesleğinin yeniden yapılanması sadece zaman meselesi. Hukuk bürolarında asistan vb. basit işleri yapan çok kişi var ve LLM’ler bu işi yapabilir. Bunlar beyaz yaka sayılıyor ama ortadan kalkacaklar
    Bu, kodlamadakine benzer şekilde ilerleyecek. Kontrol edilmesi gereken bir junior partner daha edinmek gibi ve standart belge işlerini onun yerine yapabilir
    Tamamen güvenilemez ama junior geliştiricilere de tamamen güvenmiyoruz, değil mi? Yine de sizi %80 noktasına kadar getiriyor

    • Bunun kodlamadakine benzer şekilde ilerleyeceğine bir ölçüde katılıyorum ama bu yüzden daha da kafa karıştırıcı. En azından HN’de, yapay zekanın hukuk mesleğini sarsacağı ve avukatları toplu işsiz bırakacağı yönünde yorumlar sık görülüyor ama yazılım sektörünün de aynı şekilde değişeceği pek söylenmiyor
  • İlginç bir problem alanı. Burada işe yarayabilecek bir kültürel bozuculuk tarzı hukuk teorisi var
    Diyelim ki aylık 99 dolarlık bir kendini temsil etme hizmeti iki şey yapıyor. 1) Tüm varlıkları güvenli araçlara nasıl taşıyacağınızı öğretiyor. 2) Aynı anda kendinizi temsil ederek savunma yapmanızı sağlıyor. Amaç kazanmak değil, sistemi tıkamak. Karşı tarafa hukuken iflas etmiş durumda olduğunuz sinyalini verip ardından başvuruları durmadan yaparak süreci mümkün olduğunca acı verici hale getirirseniz, temyiz sürecine kadar 5 yıl süreceğini fark edip vazgeçebilirler
    Avukatların şablon hizmetlere hukuki belgeleri vermek istemediği doğru ama dürüst olmak gerekirse, mahkemeye gidip toplu halde sunulan belgeleri toplayıp eğitmek bile yeterli olabilir. Bu stratejide mükemmel belgeler ya da hukuk teorileri şart değil. Mahkemenin belge sunum gerekliliklerini karşılayan belgeler yeterli. “Evet, hizmetçinizin kızlarının saatlik 400 dolardan ifade vermesini isteyeceğim ve bir sorununuz varsa duruşma açabilirsiniz” gibi. Yeterince çok kişi bunu yaparsa hukuk sistemi fiilen durur ve güç insanlara geri döner
    Bu tür sorunlar için mücadele ederken hayata veda eden Aaron Swartz’ı anıyorum

  • “Tüm ceza kovuşturmalarında sanık, savunması için bir avukatın yardımını alma hakkına sahiptir” — ABD Anayasası Altıncı Değişiklik
    Eğer LLM’ler ortalama bir insan avukattan daha yetkin hale gelirse, bu hüküm hâlâ insan bir avukatın yardımını mı gerektirir?

    • Dünyadaki hükümetler, insanların bu öneriyi ciddiye alması ve özellikle ceza savunmasında insan avukatlar yerine LLM kullanması için ellerinden geleni yapacaktır. Neden mi?
      Belki de bir avukatın en önemli özelliği teknik bilgi değildir
    • Kullanım alanları farklı. Avukat, yargılamanın yürütülmesi gibi işleri üstlenebilir
      LLM’ler olgu meseleleri gibi konularda yardımcı olabilir ve doğru şekilde kurulursa, avukatlardan daha güçlü gizlilik güvenceleri bile sağlayabilir. Tabii bunun gerçekten olacağı pek olası görünmüyor
    • İronik biçimde bu soruyu GPT’ye sormak daha iyi olabilir
    • Evet. LLM’ler ücretsiz değil ve çıktıları doğrulayacak uzmanlara hâlâ ihtiyaç var
    • Buna mahkeme karar verir. Böyle bir davanın geleceğini varsaymak gayet makul ve mesele sadece bunun ne kadar hızlı olacağı