- Haberler
- Bilim Teknoloji
- Yapay Zekâda Dengeler Altüst Oldu!
Yapay Zekâda Dengeler Altüst Oldu!
Yapay zekâ sektöründe modeller arasındaki rekabet hız kesmeden devam ederken, performans sıralamalarında da dikkat çekici değişimler yaşanıyor. Bağımsız değerlendirme platformu Artificial Analysis, Intelligence Index sistemini bir haftadan kısa sürede üç kez güncelledi. Son tabloda GPT-6 Astra ile Claude Fable 5.1 aynı puana ulaşarak zirveyi birlikte aldı.
Haberin Özeti
- • GPT-6 Astra ve Claude Fable 5.1, Artificial Analysis'in son değerlendirmesinde 53 puanla zirveyi paylaştı.
- • Intelligence Index sıralaması bir haftadan kısa sürede üç kez güncellendi ve yeni testlerle modeller arasındaki puanlar yeniden şekillendi.
- • Astra, aynı performans seviyesinde Fable 5.1'e göre yaklaşık yüzde 57 daha düşük görev maliyetiyle dikkat çekti.
Platformun 7 Eylül'de yayımladığı v4.3 güncellemesi, yapay zekâ modellerinin farklı görevlerdeki performanslarını daha kapsamlı değerlendirmeyi amaçlayan yeni testleri de sisteme dahil etti. Böylece kısa süre içinde değişen puanlar, sektördeki rekabetin ne kadar hızlı ilerlediğini bir kez daha ortaya koydu.
Yapay Zekâ Sıralaması Neden Peş Peşe Değişti?
Artificial Analysis, v4.1.1, v4.2 ve v4.3 sürümlerini daha kapsamlı hazırlanacak v5 güncellemesi öncesindeki hızlandırılmış değerlendirme sürecinin parçaları olarak konumlandırdı. Ancak yapay zekâ modellerindeki hızlı gelişim nedeniyle daha geniş kapsamlı güncellemenin beklenmesinin uygun olmadığı belirtildi. İlk tabloda GPT-6 Astra 61 puan, Claude Fable 5.1 ise 66 puan almıştı. Aradan yalnızca birkaç gün geçtikten sonra yapılan ikinci güncellemede değerlendirme kriterleri değiştirildi ve iki model arasındaki fark önemli ölçüde daraldı. v4.2 sürümünde GPQA Diamond testi sistemden çıkarılırken yeni değerlendirme ölçütleri eklendi. Bu değişiklik sonrasında Fable 5.1'in puanı 57'ye, Astra'nın puanı ise 55'e geriledi.
Son Güncellemeyle İki Model Zirvede Eşitlendi
Üçüncü değişiklik ise yalnızca birkaç gün sonra geldi. v4.3 sürümünde Terminal-Bench ve AutomationBench-AA testlerinin değerlendirme sistemine eklenmesiyle birlikte iki model arasındaki puan farkı tamamen ortadan kalktı. Yeni tabloda GPT-6 Astra ve Claude Fable 5.1, 53 puanla ilk sırayı paylaştı. Böylece bir haftadan kısa süre içerisinde yapay zekâ sıralamasının zirvesinde önemli bir değişim yaşandı. Ancak aynı puana sahip olmaları, iki modelin aynı özellikleri sunduğu anlamına gelmiyor. Test sonuçları, modellerin güçlü olduğu alanların birbirinden farklılaştığını gösteriyor.
Aynı Performans, Farklı Maliyet
Yapay zekâ modellerini iş süreçlerinde kullanmayı planlayan şirketler açısından puan kadar maliyet de önem taşıyor. Artificial Analysis'in v4.3 değerlendirmesine göre 53 puanlık performans seviyesinde GPT-6 Astra'nın görev başına ortalama maliyeti 3,26 dolar olarak hesaplandı. Claude Fable 5.1'de ise aynı seviyedeki görev için ortalama maliyet 7,63 dolar oldu. Bu tablo, Astra'nın benzer performans düzeyinde görev başına yaklaşık yüzde 57 daha düşük maliyet sunduğuna işaret ediyor. Maliyet farkının önemli nedenlerinden biri olarak Astra'nın değerlendirmeler sırasında daha az çıktı çipi kullanması gösteriliyor. Bu durum özellikle yüksek hacimli yapay zekâ kullanımı gerçekleştiren işletmeler açısından iki model arasındaki tercihi etkileyebilecek unsurlardan biri olarak öne çıkıyor.
Modellerin Güçlü Olduğu Alanlar Farklı
Puanların eşitlenmesine rağmen testlerin ayrıntıları iki modelin farklı alanlarda öne çıktığını ortaya koyuyor. Claude Fable 5.1, bilgiye dayalı görevlerde ve bilimsel hesaplamalarda daha başarılı sonuçlar verirken, GPT-6 Astra özellikle terminal üzerinden gerçekleştirilen yazılım görevleri ve iş akışı otomasyonlarında dikkat çekiyor. Bu nedenle toplam puanın tek başına model seçimi için yeterli olmayabileceği görülüyor. Kullanıcıların ve şirketlerin tercih yaparken gerçekleştirecekleri işin niteliğini, maliyeti ve modelin belirli görevlerdeki başarısını birlikte değerlendirmesi gerekiyor.
Gizli Testlerin Ağırlığı Artırıldı
Artificial Analysis'in değerlendirme sistemindeki önemli değişikliklerden biri de modellerin testleri önceden öğrenerek avantaj elde etmesini engellemeye yönelik oldu. Platform, gizli test setlerinin payını kademeli olarak yükseltti. v4.1 sürümünde yüzde 20 seviyesinde bulunan gizli test oranı v4.2'de yüzde 40'a çıkarıldı. v4.3 güncellemesiyle birlikte bu oran yüzde 45'e ulaştı. Platformun gelecek v5 sürümünde gizli testlerin ağırlığını daha da artırmayı planladığı belirtiliyor.
Zirvenin Hemen Ardındaki Modeller
v4.3 güncellemesinin ardından GPT-6 Astra ve Claude Fable 5.1'in 53 puanla oluşturduğu zirvenin hemen arkasında Claude Opus 5 bulunuyor. Bu model 51 puanla üçüncü sırada yer alıyor. Claude Fable 5 ise 50 puanla takip ederken, Muse Spark 1.3 modeli 48 puana ulaştı. GPT-5.6 Sol ise 47 puanla sıralamada kendine yer buldu. Açık kaynaklı modeller arasında ise GLM-5.3 Flash, 42 puanla en yüksek skora sahip model olarak öne çıktı.
Bakmadan Geçme