1 puan yazan GN⁺ 2023-10-02 | 1 yorum | WhatsApp'ta paylaş
  • Harvard Digital Data Design Institute ile BCG'nin saha deneyi, 758 danışman üzerinde yapay zekanın bilgi çalışanlarının üretkenliğini ve kalitesini ne kadar değiştirdiğini değerlendirdi
  • Görevler, danışmanların gerçek işlerine daha yakın olan yaratıcılık, analitik düşünme, yazma, ikna gücü unsurlarını içererek basit benchmark'ların ötesinde işe uygulanabilirliği görmek üzere tasarlandı
  • ChatGPT-4, yapay zekaya iyi uyan görevlerde çalışma hızını %25'ten fazla, insan değerlendirmesine göre performansı %40'tan fazla, görev tamamlama oranını %12'den fazla artırdı
  • Her iş aynı etkiyi görmüyor; güçlü ve zayıf alanların ayrıştığı inişli çıkışlı teknolojik sınır temel kısıt olarak ortaya çıktı
  • Pratik kullanım, işi bölüştüren Centaurs ile yapay zekayı iş akışına yediren Cyborgs olarak ayrılıyor; her görev için insan ve yapay zeka kombinasyonunu değerlendirmek gerekiyor

BCG danışmanlarıyla yapılan saha deneyi

  • Harvard Digital Data Design Institute'tan Karim Lakhani ve ekibi, Boston Consulting Group (BCG) ile birlikte yapay zekanın bilgi çalışanı üretkenliği ve kalite üzerindeki etkisini değerlendirdi
  • Deneye katılanlar 758 danışmandı ve bu sayı BCG'nin bireysel katkı sağlayan çalışanlarının %7'sine karşılık geliyor
  • Görevler, danışmanların günlük iş kapsamını yansıtıyordu
    • Yaratıcılık

    • Analitik düşünme

    • Yazma becerisi

      • İkna gücü

Performans artışı ve sınırlar

  • Yapay zekanın iyi çalıştığı görev alanlarında ChatGPT-4 performansı belirgin biçimde artırdı
    • Çalışma hızı %25'ten fazla arttı
    • İnsan değerlendirme ölçütlerine göre performans %40'tan fazla arttı
    • Görev tamamlama oranı %12'den fazla arttı
  • Buna karşılık, yapay zeka performansı tüm görevlerde eşit değildi
    • Bazı işlerde çok iyi sonuç verirken, diğerlerinde yetersiz kaldı
    • Bu fark jagged technological frontier kavramıyla özetleniyor

Bilgi işlerinde ortaya çıkan iki kullanım biçimi

  • Yapay zeka kullanıcıları genel olarak iki desene ayrılıyor
    • Centaurs: işi insan ile yapay zeka arasında bölüştürüp devreder
    • Cyborgs: yapay zekayı kendi iş akışına entegre eder
  • Yapay zeka kullanılsın mı kullanılmasın mı şeklindeki ikili yaklaşımdan ziyade, her iş akışında insan ve yapay zeka kombinasyonunun nasıl bir değer ürettiğini değerlendirmek önemli

1 yorum

 
GN⁺ 2023-10-02
Hacker News yorumları
  • Bu görevler GPT’ye tam uygun işler gibi görünüyor: yaratıcılık, analitik düşünme, yazma, ikna gücü gibi alanlarda 10 ayakkabı fikri, pazar segmentasyonu, basın bülteni, çalışanlara yönelik ilham notu yazdırmak gibi
    GPT’nin ilk göreve verdiği yanıt: https://chat.openai.com/share/db7556f7-6036-4b3d-a61a-9cd253...
    Kendinden emin GPT halüsinasyonları, tipik yönetim danışmanlığı materyallerinden neredeyse ayırt edilemiyor

    • “Fikirler kötü, bir elektronik tablo var, pazarlama metinleri kimsenin umurunda değil, üst yönetim tarzı saçmalıklardan kimse ilham almıyor” türünden işlerse, zaten değeri düşük olduğu için LLM’e neredeyse mükemmel girdi oluyor
    • Sadece çıktıya bakınca doğru, ama bilgi çalışanlarının değeri esas olarak girdinin niteliğinden gelir
      Müşteri “10 fikir” değil, “işi ve pazarı anlamaya dayalı değerli 10 fikir” ister. Bir yönetim danışmanı bu soruya “tekne ayakkabısı” gibi bir cevap verirse müşteriyi uzun süre elinde tutamaz
      Aynı şekilde yazılım mühendisliğinde de “bana 10 satır kod yaz” derseniz, ChatGPT’nin her gün ürettiği koddan ayırt edilemez denebilir
    • “Köpek gezdirenler için, entegre dışkı torbası dağıtıcılı” fikrinden nefret mi etmeliyim yoksa sevmeli miyim bilmiyorum; “görme engelliler için, haptik geri bildirimli” ise haptik ayakkabı demek, gerçekten yenilikçi
    • Kendinden emin GPT halüsinasyonları yönetim danışmanlığı materyallerine benziyorsa, Harvard ve çevresindeki kurumlara da çok uygun görünüyor
      İşverenim, HYP mezunlarını işe almasıyla bilinen McKinsey’i birkaç kez tuttu; çıktılar en iyi ihtimalle yetersizdi. Bu tür kurumlarla ilgili deneyimim genel olarak benzerdi
      Bunun yalnızca anekdot olduğunu biliyorum, ama bu tür araştırmalara epey doğrulama yanlılığı karışmış gibi geliyor
    • GPT’nin yanıtı MAD magazine’den alınmış gibi okunuyor
  • Bu çalışma asıl noktayı gömmüş. LLM bazı görevlerde daha iyiydi, ama başka görevlerde performansı gerçekten daha kötü hale getirdi
    İlk görev, çalışmanın “sınırın içinde” dediği genelci görev olduğu için performansın artması şaşırtıcı değil. Güçlü alan bilgisi olmadan da iyi tanımlanmış bir alanı araştırma işi; LLM’in güçlü yanlarına göre biçilmiş kaftan. Kariyerinin başındaki genç danışmanların iş analisti gibi rollerle yaptığı işler de çoğunlukla bu genelci işlerdir
    LLM çok fazla bilgiyi genelleştirdiği için bu tür genel araştırmalarda güçlüdür, ama tam da bu genelleme onun zayıflığıdır. Bir araştırma alanındaki gazeteci gibi düşünülebilir. Gazete okurken içgörü kazanıyormuşsunuz gibi gelir, ama iyi bildiğim bir alandaki yazıyı okuduğum anda analizde çok sayıda kusur olduğunu ve konuyu benim seviyemde anlamadığını fark ederim
    İkinci “sınırın dışındaki” görev elektronik tablo analizi, mülakatlar ve kanıtlarla desteklenen daha derin analiz gerektiriyordu; bunlar mevcut LLM’lerin zayıf olduğu işler. Bu yüzden LLM kullanmayan grup %84,5 alırken LLM kullanıcıları %60–70,6’da kaldı
    Sonuç şu: LLM genelleştirilmiş araştırma için harika, ancak uzmanlık gerektiren analiz işleri için daha az uygun

    • Bu, Gell-Mann amnesia’nın yeni bir versiyonu gibi. Buna LLM-man amnesia demek istiyorum
      Programlama sorusu sorduğumda ChatGPT yaklaşık %20 oranında halüsinasyon üretiyor ve ben yeterince deneyimli olduğum için bunu fark edebiliyorum. Başka alanlar hakkında sorduğumda da en az o kadar halüsinasyon ve yanlış bilgi olduğunu varsaymak gerekir gibi
    • LLM, ortalama bir bilgi çalışanının iyi yaptığı ya da nispeten hızlı eğitimle iyi yapabileceği işlerde genel olarak güçlü
    • LLM’i gazeteciye benzetmek iyi bir içgörü
  • Bu komik. GPT-3/4’ün yazma becerisi de etkileyici, ama daha çarpıcı olan insan yazısının ne kadar palavra dolu olduğu
    “İş danışmanı”, böyle palavra dolu yazının gerektiği rollerin zirvesi; ChatGPT en iyi iş danışmanından bile daha iş danışmanı gibi davranabilir
    İş yerinde ciddiye alınmak için bazen kısa fikirleri veya verileri sayfalarca belgeye ya da slayt destesine şişirmek gerekir. Böylece diğerleri hemen “emek verilmiş” olduğunu anlar
    Şu anda ChatGPT’ye en uygun rol, kısa bir metni alıp çok daha uzun ve gereksiz ayrıntılarla dolu bir belgeye genişletmek olabilir. Alıcı taraf, uzun belgeye ya da slaytlara katlanıp “iş yapılmış” diye kabul ettikten sonra, onu tekrar ChatGPT’ye koyup asıl özüne geri özetletecektir

    • Çoğu kişi LLM’in ne yapabildiğine odaklandı, ama en az onun kadar, hatta daha da ilginç olan ne yapamadığı ve bunun nedeni
      “LLM metin üretebilir” dediğimizde 10 şeritli otoyol genişliğinde bir fırça darbesi yapıyoruz. Yazmanın gerçekte ne olduğu, hangi kategorileri ve düzeyleri bulunduğu konusunda kelime dağarcığımız oldukça sınırlı görünüyor
      Örneğin kibar e-posta, LinkedIn tarzı ilham spam’i, kurumsal ifadeler söz konusu olduğunda GPT’nin ilk denemede insanları ezip geçmesi eğlenceli ve bana göre tamamen beklenen bir şey. Öte yandan Game of Thrones’un sonraki cildini ya da iyi yazılmış edebiyat istediğinizde sıkıcı, genel, klişelerle ve boş olay örgüleriyle/karakterlerle dolu hale gelip çöküyor
      Artık yazının arazisini daha iyi bir kavramsal uzaya haritalamamız gerekiyor. Şu anda aritmetik ile soyut cebir arasındaki farka denk düşen ayrımı bile yapamıyor gibiyiz
  • LLM’ler dil görevlerinde şaşırtıcı derecede iyi. Eskiden insanların doğal dil işleme dediği şeylerin çoğu artık neredeyse ezilmiş durumda. Özetleme, soru-cevap, duygu analizi vb. gerçekten şaşırtıcı bir seviyede.
    “Gerçek”in sınırlarının net olmadığı ve bir Pynchon romanı gibi yoğun biçimde birbirine kenetlenmesi gerekmeyen üretim görevlerinde de çok güçlüler. Kısa öyküler, fikir yazıları, ürün metinleri için dakikada 20 fikri prototip gibi çıkarabilen bir verimlilik yükselteci.
    Ama şu anki konum kabaca buraya kadar. Doğal dili gizil uzaya çıkarıp bir ölçüde ayrıştırılabilir kavramlar oluşturuyor, afin dönüşüme benzer bir şey yaptıktan sonra tekrar aşağı indiriyor.
    Bir bilgisayar için inanılmaz derecede etkileyici, ama pahalı bir Penn mezununun yerini gerçekten tutabilir mi derseniz, para ödenen şeyin parlak ürün stratejisi içgörüsünden başka bir şey olma ihtimali yüksek.

    • Yapay zekanın hukukta yetkinleşmesinin ne kadar süreceğini merak ediyorum. Şu anda iyi olduğu dil görevleri sanatsal görevlere benziyor. Çözüm uzayının muazzam büyük olduğu ve küçük değişikliklere dayanıklı problemleri çözüyor.
      Kızgın ağaç-insan resmini biraz değiştirseniz de hâlâ iyi bir kızgın ağaç-insan resmi olma ihtimali yüksek, bunun gibi.
    • Katılmak zor. LLM’ler alan ne kadar sınırlı olursa olsun hiçbir işi güvenilir biçimde yapamıyor.
      Çıktının kabul edilebilir görünmesinin nedeni, insanların insan beyniyle çatlakları doldurması. İnsanlar çöp çıktıyı fark ediyor, küçük belirsizlikleri gideriyor, önemsiz olgusal ve mantıksal hataları bilinçsizce düzeltiyor.
      Ama LLM sonucunu başka bir bilgisayar programına doğrudan koymazsınız. Bu da geleneksel doğal dil işleme görevlerinin çoğunu dışarıda bırakır.
    • “Eskiden insanların doğal dil işleme dediği şeylerin çoğu artık ezildi” ifadesinin çoğu prodüksiyon servisi kullanımında doğru olabilmesi için LLM’lerin en az 10 kat daha hızlı olması gerekiyor.
      Bu işleri epey iyi yapabildiklerine genel olarak katılıyorum, ama büyük ölçekli veri kümelerinde çalıştırmak için performansları hâlâ yetersiz.
    • Belirli şekilde doğal dil işlemeye dönüştürülmüş metin isterseniz çok iyi yapıyor.
      Ama hemen ardından bunu olduğu gibi kullanmamanızı, bunun “etik dışı” olduğunu söylüyor.
  • Bu daha çok BCG danışmanlarının ne kadar işe yaramaz olduğunu gösteriyor.

    • LLM’lerde de “basın, benim uzman olduğum alan dışında her konuda doğrudur” eski sözünün bir karşılığı var gibi. LLM çıktısı da benim uzman olduğum alan dışında her konuda iyi görünüyor.
      Yazarlık veya editörlük geçmişi olmayan biri, LLM’lerin bu alanı devrimleştireceğini düşünüyor. Gerçek yazarlar ve editörler ise LLM çıktısını bir kez görünce, düzeltme süresinin baştan yazma süresiyle aşağı yukarı aynı olduğunu ve bunun fiilen değersiz olduğunu anlıyor.
      Benzer şekilde, programlama bilmeyen ya da konuya dair anlayışı sığ olan kişiler, özellikle teknik görünmeye çalışan yöneticiler, LLM çıktısına bakıp hemen dağıtıma hazır sanıyor; iyi programcılar ise büyük ve küçük o kadar çok sorun olduğunu görüyor ki baştan yazmak yerine düzeltmeye değmediğini anlıyor.
    • Çoğu yönetim danışmanı işe yaramaz, ama kabul edilmesi gereken bir gerçek de var.
      20-30 kişilik bir mühendis ekibinde genelde hem teknik olarak çok iyi hem de insanlarla ilişkileri iyi olan, “neden bizimle çalışıyor ki?” dedirten bir mühendis yalnızca bir tane olur. Ama karakteri ne kadar iyi olursa olsun iş iştir; o da yönetimin nasıl olması gerektiğine dair sadece ipuçları verir. Video oyunları oynar, ailesi vardır, bir hayatı vardır; şirketin nereye gittiğiyle, yönetimle ve gereksiz sorumluluklarla ilgilenmez. Üstelik yukarıdakiler onu sadece “mühendis” olarak görür, “yönetici” olarak değil.
      Geri kalan mühendisler ve yöneticiler de “benim sorunum değil” tavrına girince tuhaf bir iletişim boşluğu oluşur. Ürüne yakın çalışan mühendis, “madem bu kadar iyi biliyorsun, sen yapsana?” denmesinden korktuğu için yöneticiyle konuşmak istemez; yönetici de “madem bu kadar ilgileniyorsun, sen yapsana?” denmesinden korktuğu için mühendisle konuşmak istemez.
      Yönetici ile mühendis arasındaki giderek büyüyen bu mesafeye yönetim danışmanı girer. Yönetim danışmanı, üst yönetimin verdiği esneklik sayesinde mühendis ile yönetici arasında gidip gelerek herkesle konuşabilir ve “o zaman sen yapsana?”ya takılıp kalmaz. Raporunu çıkarır ve bir ay içinde bir yönetici ya da mühendisin bir yıllık maaşını alır.
      Ciddi düşününce, şirketin yapması gerektiğini bilip de söylenmeyen çok şey var. Çünkü söyleyince iş artar, risk de artar. “İyi” bir yönetim danışmanı bu “yapmak istemediğimiz ama yapılması gereken” işleri bulup üst yönetime raporlar; yönetim de o işleri yaptıracak sistemi kurar. Birinin yönetim danışmanına ihtiyacı varsa beni işe alabilir. Şirketinizin neden pek iyi olmadığını 20 farklı şekilde anlatırım; bunların 18’ini ChatGPT üretir.
    • Bir ölçüde katılıyorum. LLM benim programlama çıktımı en çok JSDoc ve PR açıklamaları yazarken artırdı. Bunlar pek yapmak istemediğim işler.
    • Bu çalışma yalnızca BCG danışmanlarının işinin %40’ının gerçek katma değeri olmayan gürültü olduğunu gösteriyor. Müşteriler artık %40 indirim istemeli gibi.
    • GPT her bir şey yaptığında “bu, [hedef] hakkında daha çok şey söylüyor” kalıbının tekrarlanması daha çok şey söylüyor.
      Herhangi bir başlıkta böyle bir yorumu tahmin edebilmek komik. “Bu, [ekleyin] hakkında daha çok şey söylüyor”u sürekli kullanırsanız ifadenin kendisi anlamını yitirir. Daha anlamlı bir şey söylenemez mi?
  • Şaşırtıcı değil. GPT ürkütücü derecede iyi ve programlamayla da çok iyi örtüşüyor
    GPT-4'ten kod yazmasını isteyip çalışıp çalışmadığını deniyorum ama o kodu olduğu gibi kopyalayıp yapıştırdığım nadir oluyor. Kod tabanının bağlamına uyacak şekilde kendim yeniden yazıyorum. Yine de nasıl yapılacağından emin olmadığımda çok zaman kazandırıyor
    Öneriyi beğenmediğim zamanlar da oluyor; bu da faydalı. Çoğu zaman problem alanı kafamda daha netleşiyor

    • Dün ChatGPT'yi ilk kez kod için kullandım
      Google'da cevabını bulamadığım ve mümkün olup olmadığından da emin olmadığım epey çetrefilli bir iş verdim. İstenen şuydu: “Bir Python nesnesi verildiğinde, bu nesneyi argüman olarak almış fonksiyonların listesini ver. Mevcut kodu değiştiremem, yalnızca nesne yapısını değiştirebilirim”
      Başta fonksiyonları değiştirmek, decorator ile sarmalamak, mevcut stack trace'e bakmak gibi pek uymayan fikirler verdi; ama birkaç gidip gelmeden sonra Python tracer'ını araya girerek yakalama yöntemiyle çözelim dedi ve gerçekten çalıştı
      Şaşırtıcı olan, eğitim verisinde buna benzer bir şey görmüş olmasının pek olası görünmemesine rağmen parçaları birleştirebilmesiydi. Neredeyse insan seviyesine yakındı. Sorduğumda debugger'larla çakışabileceği sınırlamasını da kolayca açıkladı
    • Yayımlanan yazı programlama işiyle değil, “strateji danışmanları” için metin üretimiyle ilgili
      Orijinal metnin 10. sayfasındaki örnekler şu türden: göz ardı edilmiş bir pazarı veya sporu hedefleyen 10'dan fazla yeni ayakkabı fikri önermek, kullanıcılar temelinde ayakkabı endüstrisi pazar segmentasyonu yapmak, ürün tanıtımı için basın bülteni taslağı yazmak, ürünün rakip ürünlerden neden üstün olduğunu çalışanlara açıklayan ilham verici bir not yazmak
      Kişisel olarak gerçek değerinin neredeyse hiç olmadığını düşünüyorum
    • GPT-4'e problemi açıklama eyleminin kendisi de bazen cevap kadar yardımcı olabiliyor. Neredeyse güçlendirilmiş rubber duck debugging gibi
    • Bu, “olana kadar şunu bunu dene” tarzı programlamadan yalnızca bir adım uzak
      Senin böyle bir programcı olduğunu söylemiyorum ama bu tür programcıları kesinlikle mümkün kılıyor
    • Gerçekten çok iyi konuşan bir rubber duck: https://en.wikipedia.org/wiki/Rubber_duck_debugging
  • Eski bir danışman olarak aklıma şu bariz soru geliyor: Danışmanları tamamen ortadan kaldırıp GPT-4'ün müşteri için doğrudan çalışmasını sağlasak ne olur?
    Müşterinin danışmana iş yaptırması için gereksinimleri anlatması, sonucu incelemesi, geri bildirim vermesi ve birkaç toplantıya katılması gerekir
    Ama GPT-4 danışmanları çok daha iyi hale getiriyorsa, onların işini de üstlenebilecek gibi görünüyor. Dış bir grupla çalışmamaktan doğan iletişim maliyeti azalmasını da ekleyince, müşteri neden dış danışman maliyetini ve yönetim yükünü ortadan kaldırıp getiriyi doğrudan kendisi almasın?
    Bu, özellikle müşteri zaten alan uzmanıysa ve yalnızca ek insan gücüne ihtiyaç duyuyorsa daha da geçerli. Örneğin bir pazarlama marka yöneticisi kendi ürününü ve pazarlamayı iyi bilir; ama şirket içi kadro sınırları gibi nedenlerle daha fazla kaynağa ihtiyaç duyup pazarlama danışmanlarıyla çalışabilir
    BCG'nin bu araştırmaya katılmasının anlamını sonuna kadar düşünüp düşünmediğini merak ediyorum. “Danışmanların müşterilere daha iyi yardım etmesini sağlar”dan “müşterilere doğrudan yardım eder ve danışmanlara pek gerek olmadığını gösterir”e giden yol çok kısa görünüyor
    Özellikle de müşteri bir stajyer alıp eline GPT-4 verirse

    • BCG veya McKinsey gibi şirketler çoğunlukla sorumluluktan kaçınmak için vardır
      CEO açısından onları çağırıp büyük para vererek plan ve strateji hazırlatabilir; işler iyi giderse başarıyı üstlenir, gitmezse de “McKinsey uzmanlarıyla yakın çalıştım. Dolayısıyla bu benim sorumluluğum değil” diyebilir
  • HN tahmin konusunda gerçekten kötü. Daha birkaç ay önce bile LLM'lerin stokastik papağanlardan ibaret olduğunu ve hiçbir şey başaramayacağını kendinden emin şekilde söyleyen yorumlarla doluydu
    “Bir sonraki AI kışının kapıda olduğu düşüncesinden kurtulamıyorum” demek, evet tabii
    [0] https://news.ycombinator.com/item?id=23886325

    • Yönetim danışmanlarının stokastik papağan olmadığını kim iddia etti ki?
    • O yorum ayrıca “İçerik pazarlaması spam'inin maliyet etkin bir ikamesini arıyorsanız, güzel. Başardınız” da diyordu
      Yazıyı okuyunca da sözünü ettiğimiz çıktı düzeyi neredeyse tam olarak bu. Göz ardı edilmiş bir pazarı veya sporu hedefleyen 10'dan fazla yeni ayakkabı fikri, ayakkabı endüstrisi pazar segmentasyonu, ürün tanıtımı için basın bülteni, ürünün rakip ürünlerden neden üstün olduğunu anlatan çalışanlara yönelik ilham notu gibi şeyler
      Üstelik ikinci görevde LLM olmayan grup çok daha iyiydi
    • Bu makalenin çok şey kanıtladığından emin değilim. Basın bülteni kusmak, stokastik papağan tarzı bir işe daha yakın
    • Tahmin yapamamak sorun değil. Katlanması zor olan şey yeniden kalibrasyonun tamamen yokluğu
      Saçma derecede kötü bir tahmin yaptıysam, bu o konudaki modelimin yanlış olduğu ve düzeltilmesi gerektiği anlamına gelir
      Ama modeli hiç düzeltmeden tahmin yapmaya devam ediyorsam ciddi bir sorun var demektir
    • O yorum, Dropbox'ın rsync gibi bir şeyle kolayca ikame edilebileceğini söyleyen kişi gibi HN'in şeref salonuna girecek gibi
  • Zamanla birçok ofis işi GPT gibi servislerle optimize edilecek
    Yaptığım ofis işlerinin içinde tekrarlanabilir ve script'le halledilebilir çok şey olduğunu anlayacak kadar teknik sezgim vardı, ama bu script'leri bizzat yazacak kadar değil. ChatGPT sayesinde o script'leri oluşturabildim ve kusursuz çalışır hale getirmek yaklaşık 15–20 saat sürdü
    Python scripting'i çok az biliyordum; pandas veya xlswriter gibi şeyleri ise hiç bilmiyordum, ama haftada 20–25 saat kazandıran bir şey yapabildim
    HN'de programlamayı iyi bilen çok insan olduğu için ChatGPT gibi servislerin programcı olmayanlara açtığı dünyayı küçümsediklerini düşünüyorum. Tersine, merakı olmayan insanların daha az öğrenmesine de yol açabilir. Eskiden birkaç snapd servisini script'le durdurmayı öğrenmek için Google'da arayıp parçaları birleştirirdim; şimdi ChatGPT'ye soruyorum ve bir dakikadan kısa sürede çalışan bir script alıyorum

    • Tamamen katılıyorum. “X mümkün mü, nasıl yapılır”dan başlayıp, arama terimini bile bilmediğim sorunlar için defalarca kaba proof-of-concept'ler oluşturdum
  • Özette dikkat çekmeye değer iki şey var
    “Yapay zeka yeteneklerinin sınırları içinde kalan 18 gerçekçi danışmanlık görevi” deniyor. Yani GPT-4’ün yapabildiği işler kasıtlı olarak seçilmiş. GPT-4’ün yapamadığı çok iş olduğundan, performansın büyük ölçüde arttığını söylerken bunun GPT-4’e iyi uyan görevlerle sınırlı olduğu bağlamını da koymak gerekir
    Ayrıca “ortalamanın altındaki performans gösterenlerde kendi puanlarına göre %43, ortalamanın üzerindekilerde %17 artış” deniyor. GPT-4’e özellikle uygun işler seçilmiş olmasına rağmen, ortalamanın üzerindeki performans gösterenlerin iyileşmesi %17 olmuş. Genel olarak böyle bir artış görülüyorsa bu hâlâ etkileyici, ama bazı kişilerin pazarlamaya çalıştığından çok daha küçük bir oran olduğunu düşünüyorum

    • Ortalamanın altındaki performans gösterenler GPT çıktısını olduğu gibi kabul etmeye daha yatkın olabilir. Çünkü inceleyip düzenleme becerileri daha düşüktür
      Ortalamanın üzerindeki performans gösterenler kendi yeteneklerine güvendikleri için GPT çıktısını daha fazla didik didik edip değiştirme olasılığı daha yüksek. Bu yüzden ortalamanın altındaki grup nihai ürünü daha hızlı oluşturmuş olabilir; bu testte süre sınırı olduğuna göre hız önemli olmuş olmalı
      ChatGPT lafı uzatmakta çok güçlüdür; pazarlama metinleri ve ilham verici mesajlar da özünde laf kalabalığıdır. Yani görevler, yardımsız ChatGPT’ye göre özel hazırlanmış sayılır; bu da yüksek performanslıları aksine dezavantajlı duruma düşürmüş
    • Hafife alıyorsunuz. Kazançlar bileşik olarak birikir
      Verimlilikteki küçük artışlar uzun vadeli büyümede büyük bir avantaja dönüşür. %17 bile muazzam bir iyileşme