İŞ VE EKONOMİ DÜNYASININ HABER SİTESİ
  1. Haberler
  2. Dünya
  3. Yapay zeka liderlik sıralaması bir hafta içinde üç kez el değiştirdi

Yapay zeka liderlik sıralaması bir hafta içinde üç kez el değiştirdi

Sectorun önde gelen bağımsız değerlendirme merkezi Artificial Analysis, Intelligence Index ölçüm sistemini kısa bir süre içinde üç kez revize etti. 7 Eylül tarihli v4.3 güncellemesiyle OpenAI'ın GPT-6 Astra ve Anthropic'in Claude Fable 5.1 modelleri 53 puanda denk geldi.

featured
Google'da Abone Ol
0
Paylaş

Bu Yazıyı Paylaş

veya linki kopyala

Sectorun önde gelen bağımsız değerlendirme merkezi Artificial Analysis, Intelligence Index ölçüm sistemini kısa bir süre içinde üç kez revize etti. 7 Eylül tarihli v4.3 güncellemesiyle OpenAI'ın GPT-6 Astra ve Anthropic'in Claude Fable 5.1 modelleri 53 puanda denk geldi.

Artificial Analysis yetkilileri, v4.1.1, v4.2 ve v4.3 sürümlerinin, eksiksiz v5 yenilemesinden önce sektördeki hızlı gelişmeler nedeniyle ertelenemez hale gelen geçici iyileştirmeler olarak uygulandığını açıkladı.

Süreç, GPT-6 Astra'nın piyasaya sürülmesiyle v4.1.1 sürümünde başladı; bu aşamada Astra 61 puan elde ederken, rakibi Fable 5.1 66 puanda bulunuyordu.

V4.2 sürümü dört gün sonra, doygunluğa ulaşan GPQA Diamond testinin çıkarılması ve yeni metriklerin eklenmesiyle yayınlandı. Bu değişikliklerle aradaki fark kapanarak Fable 5.1'in puanı 57'ye, Astra'nın puanı ise 55'e geriledi.

Üç gün sonra gelen v4.3 güncellemesiyle Terminal-Bench ve AutomationBench-AA testleri sisteme dahil edildi ve iki model 53 puanda eşitlendi.

Aynı toplam puana ulaşmalarına rağmen modeller arasında maliyet ve performans açısından belirgin farklılıklar mevcut. V4.3 maliyet analizine göre, 53 puanlık seviyede GPT-6 Astra görev başına ortalama 3,26 dolar maliyet oluştururken, Claude Fable 5.1 için bu tutar 7,63 dolara yükseldi. Bu durum, Astra'nın aynı performans için yüzde 57 daha düşük maliyet sağladığını ortaya koydu; farkın sebebi olarak Astra'nın değerlendirme sırasında daha az çıktı çipi tüketmesi gösterildi.

Uzmanlık alanlarına bakıldığında, Fable 5.1 bilgi tabanlı görevlerde ve bilimsel hesaplamalarda üstünlük kurarken, Astra terminal odaklı yazılım işleri ve iş akışı otomasyonlarında daha başarılı sonuçlar aldı.

Modellerin ezberleme ihtimalini azaltmak için platform, gizli test setlerinin ağırlığını kademeli olarak artırdı. Bu oran v4.1'de yüzde 20 iken v4.2'de yüzde 40'a, v4.3'te ise yüzde 45'e çıkarıldı. Artificial Analysis, v5 sürümünde bu oranın daha da yükseltilmesini planlıyor.

V4.3 sıralamasında Astra ve Fable 5.1'in ardından Claude Opus 5 modeli 51 puanla üçüncü sırayı aldı. Claude Fable 5 50, Muse Spark 1.3 48 ve GPT-5.6 Sol 47 puanda kalırken, açık kaynaklı modeller arasında en yüksek skoru 42 puanla GLM-5.3 Flash elde etti.

Yapay zeka liderlik sıralaması bir hafta içinde üç kez el değiştirdi
0

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

0/30 karakter

Giriş Yap

Ekonomi ve İş Dünyasından en güncel haberler ayrıcalıklarından yararlanmak için hemen giriş yapın veya hesap oluşturun, üstelik tamamen ücretsiz!

KAI ile Sohbet Et

Sektör Gündem ile Haber Hakkında Sohbet

Yapay zeka asistanı

Yapay zeka yanlış bilgi üretebilir