İş danışmanlarının performansını büyük ölçüde artıran ChatGPT-4
(d3.harvard.edu)- Harvard Digital Data Design Institute ile BCG'nin saha deneyi, 758 danışman üzerinde yapay zekanın bilgi çalışanlarının üretkenliğini ve kalitesini ne kadar değiştirdiğini değerlendirdi
- Görevler, danışmanların gerçek işlerine daha yakın olan yaratıcılık, analitik düşünme, yazma, ikna gücü unsurlarını içererek basit benchmark'ların ötesinde işe uygulanabilirliği görmek üzere tasarlandı
- ChatGPT-4, yapay zekaya iyi uyan görevlerde çalışma hızını %25'ten fazla, insan değerlendirmesine göre performansı %40'tan fazla, görev tamamlama oranını %12'den fazla artırdı
- Her iş aynı etkiyi görmüyor; güçlü ve zayıf alanların ayrıştığı inişli çıkışlı teknolojik sınır temel kısıt olarak ortaya çıktı
- Pratik kullanım, işi bölüştüren Centaurs ile yapay zekayı iş akışına yediren Cyborgs olarak ayrılıyor; her görev için insan ve yapay zeka kombinasyonunu değerlendirmek gerekiyor
BCG danışmanlarıyla yapılan saha deneyi
- Harvard Digital Data Design Institute'tan Karim Lakhani ve ekibi, Boston Consulting Group (BCG) ile birlikte yapay zekanın bilgi çalışanı üretkenliği ve kalite üzerindeki etkisini değerlendirdi
- Deneye katılanlar 758 danışmandı ve bu sayı BCG'nin bireysel katkı sağlayan çalışanlarının %7'sine karşılık geliyor
- Görevler, danışmanların günlük iş kapsamını yansıtıyordu
-
Yaratıcılık
-
Analitik düşünme
-
Yazma becerisi
- İkna gücü
-
Performans artışı ve sınırlar
- Yapay zekanın iyi çalıştığı görev alanlarında ChatGPT-4 performansı belirgin biçimde artırdı
- Çalışma hızı %25'ten fazla arttı
- İnsan değerlendirme ölçütlerine göre performans %40'tan fazla arttı
- Görev tamamlama oranı %12'den fazla arttı
- Buna karşılık, yapay zeka performansı tüm görevlerde eşit değildi
- Bazı işlerde çok iyi sonuç verirken, diğerlerinde yetersiz kaldı
- Bu fark jagged technological frontier kavramıyla özetleniyor
Bilgi işlerinde ortaya çıkan iki kullanım biçimi
- Yapay zeka kullanıcıları genel olarak iki desene ayrılıyor
- Centaurs: işi insan ile yapay zeka arasında bölüştürüp devreder
- Cyborgs: yapay zekayı kendi iş akışına entegre eder
- Yapay zeka kullanılsın mı kullanılmasın mı şeklindeki ikili yaklaşımdan ziyade, her iş akışında insan ve yapay zeka kombinasyonunun nasıl bir değer ürettiğini değerlendirmek önemli
1 yorum
Hacker News yorumları
Bu görevler GPT’ye tam uygun işler gibi görünüyor: yaratıcılık, analitik düşünme, yazma, ikna gücü gibi alanlarda 10 ayakkabı fikri, pazar segmentasyonu, basın bülteni, çalışanlara yönelik ilham notu yazdırmak gibi
GPT’nin ilk göreve verdiği yanıt: https://chat.openai.com/share/db7556f7-6036-4b3d-a61a-9cd253...
Kendinden emin GPT halüsinasyonları, tipik yönetim danışmanlığı materyallerinden neredeyse ayırt edilemiyor
Müşteri “10 fikir” değil, “işi ve pazarı anlamaya dayalı değerli 10 fikir” ister. Bir yönetim danışmanı bu soruya “tekne ayakkabısı” gibi bir cevap verirse müşteriyi uzun süre elinde tutamaz
Aynı şekilde yazılım mühendisliğinde de “bana 10 satır kod yaz” derseniz, ChatGPT’nin her gün ürettiği koddan ayırt edilemez denebilir
İşverenim, HYP mezunlarını işe almasıyla bilinen McKinsey’i birkaç kez tuttu; çıktılar en iyi ihtimalle yetersizdi. Bu tür kurumlarla ilgili deneyimim genel olarak benzerdi
Bunun yalnızca anekdot olduğunu biliyorum, ama bu tür araştırmalara epey doğrulama yanlılığı karışmış gibi geliyor
Bu çalışma asıl noktayı gömmüş. LLM bazı görevlerde daha iyiydi, ama başka görevlerde performansı gerçekten daha kötü hale getirdi
İlk görev, çalışmanın “sınırın içinde” dediği genelci görev olduğu için performansın artması şaşırtıcı değil. Güçlü alan bilgisi olmadan da iyi tanımlanmış bir alanı araştırma işi; LLM’in güçlü yanlarına göre biçilmiş kaftan. Kariyerinin başındaki genç danışmanların iş analisti gibi rollerle yaptığı işler de çoğunlukla bu genelci işlerdir
LLM çok fazla bilgiyi genelleştirdiği için bu tür genel araştırmalarda güçlüdür, ama tam da bu genelleme onun zayıflığıdır. Bir araştırma alanındaki gazeteci gibi düşünülebilir. Gazete okurken içgörü kazanıyormuşsunuz gibi gelir, ama iyi bildiğim bir alandaki yazıyı okuduğum anda analizde çok sayıda kusur olduğunu ve konuyu benim seviyemde anlamadığını fark ederim
İkinci “sınırın dışındaki” görev elektronik tablo analizi, mülakatlar ve kanıtlarla desteklenen daha derin analiz gerektiriyordu; bunlar mevcut LLM’lerin zayıf olduğu işler. Bu yüzden LLM kullanmayan grup %84,5 alırken LLM kullanıcıları %60–70,6’da kaldı
Sonuç şu: LLM genelleştirilmiş araştırma için harika, ancak uzmanlık gerektiren analiz işleri için daha az uygun
Programlama sorusu sorduğumda ChatGPT yaklaşık %20 oranında halüsinasyon üretiyor ve ben yeterince deneyimli olduğum için bunu fark edebiliyorum. Başka alanlar hakkında sorduğumda da en az o kadar halüsinasyon ve yanlış bilgi olduğunu varsaymak gerekir gibi
Bu komik. GPT-3/4’ün yazma becerisi de etkileyici, ama daha çarpıcı olan insan yazısının ne kadar palavra dolu olduğu
“İş danışmanı”, böyle palavra dolu yazının gerektiği rollerin zirvesi; ChatGPT en iyi iş danışmanından bile daha iş danışmanı gibi davranabilir
İş yerinde ciddiye alınmak için bazen kısa fikirleri veya verileri sayfalarca belgeye ya da slayt destesine şişirmek gerekir. Böylece diğerleri hemen “emek verilmiş” olduğunu anlar
Şu anda ChatGPT’ye en uygun rol, kısa bir metni alıp çok daha uzun ve gereksiz ayrıntılarla dolu bir belgeye genişletmek olabilir. Alıcı taraf, uzun belgeye ya da slaytlara katlanıp “iş yapılmış” diye kabul ettikten sonra, onu tekrar ChatGPT’ye koyup asıl özüne geri özetletecektir
“LLM metin üretebilir” dediğimizde 10 şeritli otoyol genişliğinde bir fırça darbesi yapıyoruz. Yazmanın gerçekte ne olduğu, hangi kategorileri ve düzeyleri bulunduğu konusunda kelime dağarcığımız oldukça sınırlı görünüyor
Örneğin kibar e-posta, LinkedIn tarzı ilham spam’i, kurumsal ifadeler söz konusu olduğunda GPT’nin ilk denemede insanları ezip geçmesi eğlenceli ve bana göre tamamen beklenen bir şey. Öte yandan Game of Thrones’un sonraki cildini ya da iyi yazılmış edebiyat istediğinizde sıkıcı, genel, klişelerle ve boş olay örgüleriyle/karakterlerle dolu hale gelip çöküyor
Artık yazının arazisini daha iyi bir kavramsal uzaya haritalamamız gerekiyor. Şu anda aritmetik ile soyut cebir arasındaki farka denk düşen ayrımı bile yapamıyor gibiyiz
LLM’ler dil görevlerinde şaşırtıcı derecede iyi. Eskiden insanların doğal dil işleme dediği şeylerin çoğu artık neredeyse ezilmiş durumda. Özetleme, soru-cevap, duygu analizi vb. gerçekten şaşırtıcı bir seviyede.
“Gerçek”in sınırlarının net olmadığı ve bir Pynchon romanı gibi yoğun biçimde birbirine kenetlenmesi gerekmeyen üretim görevlerinde de çok güçlüler. Kısa öyküler, fikir yazıları, ürün metinleri için dakikada 20 fikri prototip gibi çıkarabilen bir verimlilik yükselteci.
Ama şu anki konum kabaca buraya kadar. Doğal dili gizil uzaya çıkarıp bir ölçüde ayrıştırılabilir kavramlar oluşturuyor, afin dönüşüme benzer bir şey yaptıktan sonra tekrar aşağı indiriyor.
Bir bilgisayar için inanılmaz derecede etkileyici, ama pahalı bir Penn mezununun yerini gerçekten tutabilir mi derseniz, para ödenen şeyin parlak ürün stratejisi içgörüsünden başka bir şey olma ihtimali yüksek.
Kızgın ağaç-insan resmini biraz değiştirseniz de hâlâ iyi bir kızgın ağaç-insan resmi olma ihtimali yüksek, bunun gibi.
Çıktının kabul edilebilir görünmesinin nedeni, insanların insan beyniyle çatlakları doldurması. İnsanlar çöp çıktıyı fark ediyor, küçük belirsizlikleri gideriyor, önemsiz olgusal ve mantıksal hataları bilinçsizce düzeltiyor.
Ama LLM sonucunu başka bir bilgisayar programına doğrudan koymazsınız. Bu da geleneksel doğal dil işleme görevlerinin çoğunu dışarıda bırakır.
Bu işleri epey iyi yapabildiklerine genel olarak katılıyorum, ama büyük ölçekli veri kümelerinde çalıştırmak için performansları hâlâ yetersiz.
Ama hemen ardından bunu olduğu gibi kullanmamanızı, bunun “etik dışı” olduğunu söylüyor.
Bu daha çok BCG danışmanlarının ne kadar işe yaramaz olduğunu gösteriyor.
Yazarlık veya editörlük geçmişi olmayan biri, LLM’lerin bu alanı devrimleştireceğini düşünüyor. Gerçek yazarlar ve editörler ise LLM çıktısını bir kez görünce, düzeltme süresinin baştan yazma süresiyle aşağı yukarı aynı olduğunu ve bunun fiilen değersiz olduğunu anlıyor.
Benzer şekilde, programlama bilmeyen ya da konuya dair anlayışı sığ olan kişiler, özellikle teknik görünmeye çalışan yöneticiler, LLM çıktısına bakıp hemen dağıtıma hazır sanıyor; iyi programcılar ise büyük ve küçük o kadar çok sorun olduğunu görüyor ki baştan yazmak yerine düzeltmeye değmediğini anlıyor.
20-30 kişilik bir mühendis ekibinde genelde hem teknik olarak çok iyi hem de insanlarla ilişkileri iyi olan, “neden bizimle çalışıyor ki?” dedirten bir mühendis yalnızca bir tane olur. Ama karakteri ne kadar iyi olursa olsun iş iştir; o da yönetimin nasıl olması gerektiğine dair sadece ipuçları verir. Video oyunları oynar, ailesi vardır, bir hayatı vardır; şirketin nereye gittiğiyle, yönetimle ve gereksiz sorumluluklarla ilgilenmez. Üstelik yukarıdakiler onu sadece “mühendis” olarak görür, “yönetici” olarak değil.
Geri kalan mühendisler ve yöneticiler de “benim sorunum değil” tavrına girince tuhaf bir iletişim boşluğu oluşur. Ürüne yakın çalışan mühendis, “madem bu kadar iyi biliyorsun, sen yapsana?” denmesinden korktuğu için yöneticiyle konuşmak istemez; yönetici de “madem bu kadar ilgileniyorsun, sen yapsana?” denmesinden korktuğu için mühendisle konuşmak istemez.
Yönetici ile mühendis arasındaki giderek büyüyen bu mesafeye yönetim danışmanı girer. Yönetim danışmanı, üst yönetimin verdiği esneklik sayesinde mühendis ile yönetici arasında gidip gelerek herkesle konuşabilir ve “o zaman sen yapsana?”ya takılıp kalmaz. Raporunu çıkarır ve bir ay içinde bir yönetici ya da mühendisin bir yıllık maaşını alır.
Ciddi düşününce, şirketin yapması gerektiğini bilip de söylenmeyen çok şey var. Çünkü söyleyince iş artar, risk de artar. “İyi” bir yönetim danışmanı bu “yapmak istemediğimiz ama yapılması gereken” işleri bulup üst yönetime raporlar; yönetim de o işleri yaptıracak sistemi kurar. Birinin yönetim danışmanına ihtiyacı varsa beni işe alabilir. Şirketinizin neden pek iyi olmadığını 20 farklı şekilde anlatırım; bunların 18’ini ChatGPT üretir.
Herhangi bir başlıkta böyle bir yorumu tahmin edebilmek komik. “Bu, [ekleyin] hakkında daha çok şey söylüyor”u sürekli kullanırsanız ifadenin kendisi anlamını yitirir. Daha anlamlı bir şey söylenemez mi?
Şaşırtıcı değil. GPT ürkütücü derecede iyi ve programlamayla da çok iyi örtüşüyor
GPT-4'ten kod yazmasını isteyip çalışıp çalışmadığını deniyorum ama o kodu olduğu gibi kopyalayıp yapıştırdığım nadir oluyor. Kod tabanının bağlamına uyacak şekilde kendim yeniden yazıyorum. Yine de nasıl yapılacağından emin olmadığımda çok zaman kazandırıyor
Öneriyi beğenmediğim zamanlar da oluyor; bu da faydalı. Çoğu zaman problem alanı kafamda daha netleşiyor
Google'da cevabını bulamadığım ve mümkün olup olmadığından da emin olmadığım epey çetrefilli bir iş verdim. İstenen şuydu: “Bir Python nesnesi verildiğinde, bu nesneyi argüman olarak almış fonksiyonların listesini ver. Mevcut kodu değiştiremem, yalnızca nesne yapısını değiştirebilirim”
Başta fonksiyonları değiştirmek, decorator ile sarmalamak, mevcut stack trace'e bakmak gibi pek uymayan fikirler verdi; ama birkaç gidip gelmeden sonra Python tracer'ını araya girerek yakalama yöntemiyle çözelim dedi ve gerçekten çalıştı
Şaşırtıcı olan, eğitim verisinde buna benzer bir şey görmüş olmasının pek olası görünmemesine rağmen parçaları birleştirebilmesiydi. Neredeyse insan seviyesine yakındı. Sorduğumda debugger'larla çakışabileceği sınırlamasını da kolayca açıkladı
Orijinal metnin 10. sayfasındaki örnekler şu türden: göz ardı edilmiş bir pazarı veya sporu hedefleyen 10'dan fazla yeni ayakkabı fikri önermek, kullanıcılar temelinde ayakkabı endüstrisi pazar segmentasyonu yapmak, ürün tanıtımı için basın bülteni taslağı yazmak, ürünün rakip ürünlerden neden üstün olduğunu çalışanlara açıklayan ilham verici bir not yazmak
Kişisel olarak gerçek değerinin neredeyse hiç olmadığını düşünüyorum
Senin böyle bir programcı olduğunu söylemiyorum ama bu tür programcıları kesinlikle mümkün kılıyor
Eski bir danışman olarak aklıma şu bariz soru geliyor: Danışmanları tamamen ortadan kaldırıp GPT-4'ün müşteri için doğrudan çalışmasını sağlasak ne olur?
Müşterinin danışmana iş yaptırması için gereksinimleri anlatması, sonucu incelemesi, geri bildirim vermesi ve birkaç toplantıya katılması gerekir
Ama GPT-4 danışmanları çok daha iyi hale getiriyorsa, onların işini de üstlenebilecek gibi görünüyor. Dış bir grupla çalışmamaktan doğan iletişim maliyeti azalmasını da ekleyince, müşteri neden dış danışman maliyetini ve yönetim yükünü ortadan kaldırıp getiriyi doğrudan kendisi almasın?
Bu, özellikle müşteri zaten alan uzmanıysa ve yalnızca ek insan gücüne ihtiyaç duyuyorsa daha da geçerli. Örneğin bir pazarlama marka yöneticisi kendi ürününü ve pazarlamayı iyi bilir; ama şirket içi kadro sınırları gibi nedenlerle daha fazla kaynağa ihtiyaç duyup pazarlama danışmanlarıyla çalışabilir
BCG'nin bu araştırmaya katılmasının anlamını sonuna kadar düşünüp düşünmediğini merak ediyorum. “Danışmanların müşterilere daha iyi yardım etmesini sağlar”dan “müşterilere doğrudan yardım eder ve danışmanlara pek gerek olmadığını gösterir”e giden yol çok kısa görünüyor
Özellikle de müşteri bir stajyer alıp eline GPT-4 verirse
CEO açısından onları çağırıp büyük para vererek plan ve strateji hazırlatabilir; işler iyi giderse başarıyı üstlenir, gitmezse de “McKinsey uzmanlarıyla yakın çalıştım. Dolayısıyla bu benim sorumluluğum değil” diyebilir
HN tahmin konusunda gerçekten kötü. Daha birkaç ay önce bile LLM'lerin stokastik papağanlardan ibaret olduğunu ve hiçbir şey başaramayacağını kendinden emin şekilde söyleyen yorumlarla doluydu
“Bir sonraki AI kışının kapıda olduğu düşüncesinden kurtulamıyorum” demek, evet tabii
[0] https://news.ycombinator.com/item?id=23886325
Yazıyı okuyunca da sözünü ettiğimiz çıktı düzeyi neredeyse tam olarak bu. Göz ardı edilmiş bir pazarı veya sporu hedefleyen 10'dan fazla yeni ayakkabı fikri, ayakkabı endüstrisi pazar segmentasyonu, ürün tanıtımı için basın bülteni, ürünün rakip ürünlerden neden üstün olduğunu anlatan çalışanlara yönelik ilham notu gibi şeyler
Üstelik ikinci görevde LLM olmayan grup çok daha iyiydi
Saçma derecede kötü bir tahmin yaptıysam, bu o konudaki modelimin yanlış olduğu ve düzeltilmesi gerektiği anlamına gelir
Ama modeli hiç düzeltmeden tahmin yapmaya devam ediyorsam ciddi bir sorun var demektir
Zamanla birçok ofis işi GPT gibi servislerle optimize edilecek
Yaptığım ofis işlerinin içinde tekrarlanabilir ve script'le halledilebilir çok şey olduğunu anlayacak kadar teknik sezgim vardı, ama bu script'leri bizzat yazacak kadar değil. ChatGPT sayesinde o script'leri oluşturabildim ve kusursuz çalışır hale getirmek yaklaşık 15–20 saat sürdü
Python scripting'i çok az biliyordum; pandas veya xlswriter gibi şeyleri ise hiç bilmiyordum, ama haftada 20–25 saat kazandıran bir şey yapabildim
HN'de programlamayı iyi bilen çok insan olduğu için ChatGPT gibi servislerin programcı olmayanlara açtığı dünyayı küçümsediklerini düşünüyorum. Tersine, merakı olmayan insanların daha az öğrenmesine de yol açabilir. Eskiden birkaç snapd servisini script'le durdurmayı öğrenmek için Google'da arayıp parçaları birleştirirdim; şimdi ChatGPT'ye soruyorum ve bir dakikadan kısa sürede çalışan bir script alıyorum
Özette dikkat çekmeye değer iki şey var
“Yapay zeka yeteneklerinin sınırları içinde kalan 18 gerçekçi danışmanlık görevi” deniyor. Yani GPT-4’ün yapabildiği işler kasıtlı olarak seçilmiş. GPT-4’ün yapamadığı çok iş olduğundan, performansın büyük ölçüde arttığını söylerken bunun GPT-4’e iyi uyan görevlerle sınırlı olduğu bağlamını da koymak gerekir
Ayrıca “ortalamanın altındaki performans gösterenlerde kendi puanlarına göre %43, ortalamanın üzerindekilerde %17 artış” deniyor. GPT-4’e özellikle uygun işler seçilmiş olmasına rağmen, ortalamanın üzerindeki performans gösterenlerin iyileşmesi %17 olmuş. Genel olarak böyle bir artış görülüyorsa bu hâlâ etkileyici, ama bazı kişilerin pazarlamaya çalıştığından çok daha küçük bir oran olduğunu düşünüyorum
Ortalamanın üzerindeki performans gösterenler kendi yeteneklerine güvendikleri için GPT çıktısını daha fazla didik didik edip değiştirme olasılığı daha yüksek. Bu yüzden ortalamanın altındaki grup nihai ürünü daha hızlı oluşturmuş olabilir; bu testte süre sınırı olduğuna göre hız önemli olmuş olmalı
ChatGPT lafı uzatmakta çok güçlüdür; pazarlama metinleri ve ilham verici mesajlar da özünde laf kalabalığıdır. Yani görevler, yardımsız ChatGPT’ye göre özel hazırlanmış sayılır; bu da yüksek performanslıları aksine dezavantajlı duruma düşürmüş
Verimlilikteki küçük artışlar uzun vadeli büyümede büyük bir avantaja dönüşür. %17 bile muazzam bir iyileşme