İçindekiler
OpenAI’nin 14 Mart 2023’te duyurduğu GPT-4, GPT-3.5’e göre özellikle karmaşık talimatları izleme, problem çözme ve görsel içerikleri yorumlama alanlarında ilerleme sundu. Bu yazıda iki modeli, ilk yayımlandıkları döneme ilişkin OpenAI verileri üzerinden karşılaştırıyoruz.

| Girdi türü | Karşılaştırılan özgün model metin girdisiyle çalışır. | Metin ve görsel girdilerini işleyebilir; bu karşılaştırmadaki GPT-4’ün çıktısı metindir. |
| Karmaşık görevler | Çok adımlı ve ayrıntılı görevlerde daha fazla zorlanabilir. | OpenAI’nin yayımladığı değerlendirmelerde karmaşık görevlerde daha güçlü sonuçlar vermiştir. |
| Ayrıntılı talimatlar | Uzun veya çok koşullu yönergelerde ayrıntıları kaçırabilir. | İnce ayrımları ve çok koşullu yönergeleri izleme konusunda daha başarılıdır. |
| Olgusal doğruluk | Hatalı veya uydurma bilgi üretebilir. | Karşılaştırmalı testlerde daha iyi performans gösterse de hatalı bilgi üretebilir. |
| Güvenlik değerlendirmeleri | Zararlı isteklere verilen yanıtlar açısından daha zayıf sonuçlar göstermiştir. | OpenAI’nin o dönemki değerlendirmelerinde uygunsuz isteklere yanıt verme eğilimi azaltılmıştır. |

1. Görsel Girdileri Anlama
İki model arasındaki en belirgin farklardan biri, GPT-4’ün görsel girdilerle çalışabilmesidir. OpenAI’nin ilk GPT-4 tanıtımında model, metin ve görselleri girdi olarak kabul edip metin çıktısı üreten çok modlu bir model olarak tanımlandı. Örneğin bir ekran görüntüsü hakkında soru sorulduğunda içeriğini yorumlayıp yazılı yanıt verebilir. GPT-3.5 ile yapılan bu özgün model karşılaştırmasında ise girdi metindir.
Buradaki ayrım önemlidir: GPT-4’ün görseli anlayabilmesi, ilk GPT-4 modelinin görsel çıktı ürettiği anlamına gelmez. Ayrıca görsel girdi özelliğinin belirli bir ürün veya hizmette kullanılabilir olması, o ürünün sunduğu özelliklere bağlıdır.
2. Karmaşık Problemleri Çözme
GPT-4, birden fazla adım gerektiren sorularda ve çeşitli akademik değerlendirmelerde GPT-3.5’ten daha yüksek performans göstermiştir. OpenAI’nin yayımladığı örneklerden birinde GPT-4, simüle edilmiş bir baro sınavında katılımcıların yaklaşık en üst yüzde 10’luk dilimine denk gelen sonuç alırken GPT-3.5 yaklaşık en alt yüzde 10’luk dilimde kalmıştır.
Bu sonuç, GPT-4’ün her hukuk sorusunu doğru çözdüğü anlamına gelmez. Sınav karşılaştırması, belirli bir testteki göreli performansı gösterir. Her iki model de gerçek bir işte yanlış çıkarım yapabilir; özellikle sonucu önemli olan görevlerde üretilen bilgi kontrol edilmelidir.
3. Ayrıntılı Talimatları İzleme
Bir metnin belirli bir tonda yazılması, birkaç koşula uyması ve verilen bilgilerin dışına çıkmaması istendiğinde iki model arasındaki fark daha görünür hâle gelir. OpenAI, gündelik sohbetlerde ayrımın sınırlı olabileceğini; görev karmaşıklaştığında GPT-4’ün daha güvenilir, yaratıcı ve ayrıntılı yönergeleri izlemekte daha başarılı olduğunu belirtmiştir.
Bu, GPT-3.5’in kısa ve basit metinleri hazırlayamayacağı anlamına gelmez. Fark özellikle çok sayıda kuralın aynı anda uygulanması veya uzun bir içeriğin dikkatle yorumlanması gerektiğinde ortaya çıkar.
4. Olgusal Doğruluk ve Hata Riski
OpenAI’nin GPT-4 teknik raporunda, iç değerlendirmelerde GPT-4’ün incelenen GPT-3.5 sürümünden daha iyi sonuç verdiği aktarılır. Bununla birlikte GPT-4 de olmayan bilgileri varmış gibi yazabilir veya akıl yürütme hatası yapabilir. Dolayısıyla “GPT-4 her zaman doğrudur” ifadesi yanlıştır.
Özellikle araştırma, sağlık, hukuk veya finans gibi alanlarda modelin yanıtını tek başına kaynak olarak kullanmayın. Ayrıca GPT-4’ün bütün yanıtlarında kaynakları kendiliğinden tespit edip doğru alıntıladığı ya da intihali otomatik olarak önlediği iddiası da bu karşılaştırmanın bir parçası değildir. Kaynağı, tarihini ve alıntının doğruluğunu ayrıca kontrol etmek gerekir.
5. Güvenlik Yaklaşımı
OpenAI, GPT-4’ün geliştirilmesinde güvenlik testleri ve geri bildirimlerden yararlandığını açıkladı. Kurumun yayımladığı değerlendirmelerde GPT-4’ün yasaklı isteklere yanıt verme eğilimi GPT-3.5’e kıyasla daha düşük çıkmıştır. Bu sonuç, modelin zararlı veya yanıltıcı içerik üretme riskinin tamamen ortadan kalktığı anlamına gelmez.
Bu nedenle iki modeli karşılaştırırken güvenliği mutlak bir özellik gibi görmek yerine, yayımlanan testlerdeki iyileşme ve devam eden sınırlamalar üzerinden değerlendirmek daha doğrudur.
GPT-4’ün Parametre Sayısı GPT-3.5’ten Fazla mı?
İnternette GPT-4 için “1 trilyon”, GPT-3.5 için “175 milyar” gibi sayılarla karşılaşabilirsiniz. Ancak OpenAI’nin GPT-4 teknik raporu model boyutu dâhil mimari ayrıntıları açıklamıyor. Bu nedenle bu rakamları doğrulanmış bir karşılaştırma olarak vermek doğru değildir. Parametre sayısından yola çıkarak hangi modelin ne kadar doğru yanıt vereceğini kesin biçimde hesaplamak da mümkün değildir. GPT-4 ile GPT-3.5 arasındaki doğrulanabilir farklar; görsel girdileri işleme, karmaşık görevlerdeki karşılaştırmalı performans ve ayrıntılı talimatları takip etme alanlarında belirginleşir. Her iki modelin de yanıtları, kullanım amacına göre gözden geçirilmeli ve önemli bilgiler güvenilir kaynaklarla doğrulanmalıdır.
