AI benchmark'ları nasıl okunur?
GPQA, Humanity's Last Exam, SWE-bench ve genel zekâ endeksleri neyi ölçer? Model karşılaştırmalarını doğru okumak için kısa rehber.

Her yeni model duyurusu bir benchmark tablosuyla geliyor ve her şirket kendi modelini “en iyi” ilan ediyor. Bu tabloları doğru okumak için hangi testin neyi ölçtüğünü bilmek yeterli.
En çok karşılaşacağınız testler
- GPQA Diamond: Biyoloji, fizik ve kimyada doktora seviyesinde 198 çoktan seçmeli soru. Alanın uzmanları yaklaşık %65, internete erişimi olan uzman olmayanlar yaklaşık %34 başarı gösteriyor. Bilimsel akıl yürütmeyi ölçer.
- Humanity’s Last Exam (HLE): Center for AI Safety ve Scale AI’ın Ocak 2025’te yayımladığı, onlarca alandan 2.500 zor soru. Mevcut modellerin en zorlandığı testlerden biri.
- SWE-bench Verified: 12 açık kaynak Python projesindeki gerçek GitHub sorunlarından, insanlar tarafından kontrol edilmiş 500 görev. Modelin gerçek bir yazılım hatasını düzeltip düzeltemediğini ölçer.
- Genel endeksler: Artificial Analysis’in zekâ endeksi gibi ölçümler birçok testi tek bir puanda birleştirir. Hızlı karşılaştırma için kullanışlıdır.
Okurken dikkat edilecek 3 şey
- Ayar farkı: Aynı model “düşük” ve “maksimum” akıl yürütme ayarında çok farklı puan alabilir. Karşılaştırdığınız rakamların aynı ayarda olduğundan emin olun.
- Kim ölçtü? Şirketin kendi açıkladığı puanlar ile bağımsız kuruluşların ölçtükleri farklı olabilir. Bağımsız ölçümler daha güvenilirdir.
- Tek test her şey değildir: Kodlamada zirvede olan bir model yazı yazmada ortalama kalabilir. İşinize en yakın testlere bakın.
Güncel sıralamayı AI Modelleri sayfamızda görebilirsiniz.
Ücretsiz üyelik
Devamı üyelere özel
Yazının tamamını ve detaylı verileri görmek için ücretsiz üye olun. Google hesabınızla tek tıkla giriş yapabilirsiniz.
Üyelik sistemi çok yakında açılıyor.
Yorumlar
Yorum yazmak ve beğenmek için ücretsiz üye olun.
Henüz yorum yok. İlk yorumu siz yazın.