GPT-5.6 Sol, Opus 5'i Geçti mi? Skorun Arkasındaki Küçük Detay

OpenAI, GPT-5.6 Sol'un ARC-AGI-3'te Opus 5'i geçtiğini duyurdu; ancak skor sadece özel API ayarlarıyla elde edildi, resmi testte sonuç çok daha düşük.

GPT-5.6 Sol, Opus 5'i Geçti mi? Skorun Arkasındaki Küçük Detay
Görsel: The Decoder
Okuma Süresi: 2 dk
Selin ÖlçerRakamlar konuşur, o tercüme eder
Yapay zeka destekli müstear kalem · Editoryal sorumluluk: Osman Aslan

Anthropic'in Claude Opus 5'i ARC-AGI-3 mantık testinde rekoru dört katına çıkardığında, OpenAI'nin sessiz kalması beklenmiyordu. Şirket şimdi GPT-5.6 Sol'un aynı testte yüzde 38,3 skorladığını ve Opus 5'in yüzde 30,2'lik sonucunu geride bıraktığını duyurdu. Rakamlar kağıt üzerinde net bir üstünlük gösteriyor; ancak metodolojiye bakıldığında tablo değişiyor.

OpenAI bu skoru resmi ARC Prize test ortamında değil, kendi Responses API'si üzerinden elde etti. Kullanılan iki ek ayar dikkat çekici: "Retained Reasoning" (akıl yürütme zincirini adımlar arasında koruma) ve "Compaction" (eski bağlamı kırpmak yerine özetleme). Bu iki mekanizma devre dışı bırakılıp model resmi test ortamına sokulduğunda skor yüzde 7,8'e geriliyor — yani neredeyse beş kat düşüş. Opus 5 ise kendi yüzde 30,2'lik sonucuna böyle bir yardımcı olmadan ulaştı.

Bu Ne Anlama Geliyor?

OpenAI'nin savunması şu: hiçbir benchmark saf modeli ölçmez, modelin çalıştığı teknik altyapı da sonucu belirler. Bu iddia teknik olarak doğru, fakat ARC-AGI-3'ün tasarım amacı tam olarak bunun tersi — sağlayıcıya özgü ayarlardan bağımsız, saf model performansını karşılaştırmak. ARC Prize de OpenAI'nin sonuçlarına verdiği yanıtta bu noktayı vurguladı: standart yaklaşım, adil kıyaslama için sağlayıcıya özel optimizasyonları dışarıda bırakıyor.

İşin can alıcı kısmı, ARC Prize kurucu ortağı François Chollet'in açıklamasında ortaya çıktı. Chollet, "benchmarkı çözmek için özel üretilmiş" test düzeneklerinin kabul edilemez olduğunu, ancak "ARC-AGI-3 için geliştirilmemiş ve tüm API kullanıcılarına açık" genel amaçlı ayarların meşru sayılabileceğini söyledi. Bu ifade aslında örtük bir itiraf: ARC Prize'ın kendi GPT-5.6 Sol testinde kullandığı eski tarz completions API'si, Claude API'sinin zaten sunduğu bazı özellikleri barındırmıyordu — yani karşılaştırma OpenAI aleyhine dengesiz kurulmuş olabilir. Chollet, farklı sağlayıcıların farklı ayarlar kullanmasının "potansiyel bir eşitlik sorunu" yarattığını kabul etse de, ayarlar ve maliyet açıkça raporlandığı sürece bunu kabul edilebilir buluyor.

Sonuç olarak elimizde iki farklı gerçeklik var: OpenAI'nin optimize edilmiş API koşullarında yüzde 38,3, standart koşullarda yüzde 7,8. Bu fark, benchmark sonuçlarını okurken "hangi koşulda?" sorusunun neden "kaç puan?" sorusundan daha önemli olduğunu gösteriyor. Daha önce GPT-5.6'nın verimlilik odaklı tasarımını incelediğimizde de benzer bir örüntü vardı: OpenAI son dönemde ham zeka yarışından çok, sistem mühendisliğiyle skor optimize etme stratejisine ağırlık veriyor. Buna karşılık Opus 5'in Fable 5'e ne kadar yaklaştığını tartıştığımız yazıda gördüğümüz gibi, Anthropic tarafı iddialarını daha sade koşullarda test ettirmeye yatkın görünüyor.

Bu tartışma aslında sektörün genel bir sorununu gözler önüne seriyor: modeller arası karşılaştırmalar artık sadece "kim daha zeki" sorusuna değil, "kim benchmarkı kendi altyapısına göre en iyi şekilde kalibre etmiş" sorusuna dönüşüyor. ARC Prize gibi bağımsız kuruluşların test metodolojisini şeffaf tutması bu yüzden kritik önem taşıyor; aksi halde şirketlerin duyurduğu rekor skorlar, gerçek yetenekten çok API mühendisliğinin başarısını yansıtabilir.

Türkiye'deki geliştiriciler ve kurumsal karar vericiler için pratik ders şu: bir modelin "rekor kırdı" haberini gördüğünüzde, hangi API ayarlarıyla, hangi maliyetle ve hangi test ortamında elde edildiğini sorgulamak gerekiyor. Aksi takdirde üretim ortamında beklenen performansla pazarlama materyalindeki sayı arasında ciddi bir uçurum çıkabilir — özellikle Retained Reasoning ve Compaction gibi ek özellikler her API planında sunulmuyor.

Sık Sorulan Sorular

GPT-5.6 Sol gerçekten Opus 5'i geçti mi?
Sadece OpenAI'nin kendi API'sinde, Retained Reasoning ve Compaction adlı iki özel ayar açıkken. Resmi ARC-AGI-3 test ortamında GPT-5.6 Sol yüzde 7,8'de kalıyor; bu da Opus 5'in aldığı yüzde 30,2'nin oldukça altında.
Retained Reasoning ve Compaction ne işe yarıyor?
Retained Reasoning, modelin akıl yürütme zincirini adımlar arasında saklayarak bilgi kaybını önlüyor. Compaction ise eski bağlamı silmek yerine özetleyerek modelin daha uzun süre bağlam tutmasını sağlıyor. İkisi de resmi test ortamında devre dışı.
ARC Prize bu duruma nasıl tepki verdi?
Kurucu ortak François Chollet, benchmarka özel geliştirilmiş düzenekleri kabul edilemez, ancak tüm kullanıcılara açık genel API ayarlarını meşru buldu. Ayrıca ARC Prize'ın eski test API'sinin OpenAI'yi dezavantajlı konuma soktuğunu zımnen kabul etti.
ARC-AGI-3 benchmarkı ne ölçüyor?
ARC-AGI-3, modellerin ezberlenmiş kalıplardan çok gerçek soyut akıl yürütme becerisini test etmek için tasarlanmış bir mantık benchmarkı. Standart, sağlayıcıya özgü olmayan bir test ortamı kullanarak adil kıyaslama hedefliyor.

Kaynak: The DecoderBu haber, kaynaktaki gelişme temel alınarak Yapay Zekanın Nabzı editoryal süreciyle hazırlanmıştır.

OpenAIAnthropicARC-AGI-3GPT-5.6 SolClaude Opus 5benchmark

Yapay zeka gündemini kaçırma 🤖

Günün tüm haberleri, yayınlandığı anda Telegram kanalında.

✈️ Kanala Katıl

Son Haberler