2026 AYT · Sosyal Bilimler-2

Yöntem notları

net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Sosyal Bilimler-2 neti × 3

Lider model
GPT-5.6 Luna (low)220,00SB2 Puanı
Model
74
Soru
40
Model–soru yanıtı
2.960
Ölçülen toplam maliyet
≈$19.16
Koşu tarihi
31 Temmuz 2026
SıraModelSB2 PuanıNetMaliyetToken
#1GPT-5.6 Luna (low)220,0040,00$0.0017.564
#2GPT-5.6 Luna (medium)220,0040,00$0.0118.754
#3GPT-5.6 Luna (high)220,0040,00$0.0122.353
#4GPT-5.6 Luna (xhigh)220,0040,00$0.0125.774
#5GPT-5.6 Luna (max)220,0040,00$0.0134.500

Tüm benchmark analizi

Tüm sonuçlar

Liderlik tablosu

Başlıkları seçerek sıralamayı değiştirebilirsiniz; bilinmeyen değerler her zaman sona gider.

Model
1GPT-5.6 Luna (low)OpenAI220,0040,0040,00$0.0017.564
2GPT-5.6 Luna (medium)OpenAI220,0040,0040,00$0.0118.754
3GPT-5.6 Luna (high)OpenAI220,0040,0040,00$0.0122.353
4GPT-5.6 Luna (xhigh)OpenAI220,0040,0040,00$0.0125.774
5GPT-5.6 Luna (max)OpenAI220,0040,0040,00$0.0134.500
6Thinky Inkling (low)Thinking Machines Lab220,0040,0040,00$0.0215.183
7GPT-5.6 Terra (low)OpenAI220,0040,0040,00$0.0416.491
8GPT-5.6 Terra (high)OpenAI220,0040,0040,00$0.0517.770
9GPT-5.6 Terra (xhigh)OpenAI220,0040,0040,00$0.0518.491
10Thinky Inkling (medium)Thinking Machines Lab220,0040,0040,00$0.0622.822
11Gemini 3.6 Flash (minimal)Google220,0040,0040,00$0.0819.213
12Gemini 3.6 Flash (low)Google220,0040,0040,00$0.1325.759
13Claude Sonnet 5 (high)Anthropic220,0040,0040,00$0.1329.086
14GPT-5.6 Sol (none)OpenAI220,0040,0040,00$0.1414.507
15GPT-5.6 Terra (max)OpenAI220,0040,0040,00$0.1840.463
16GPT-5.6 Sol (low)OpenAI220,0040,0040,00$0.1915.950
17GPT-5.6 Sol (medium)OpenAI220,0040,0040,00$0.2016.311
18Gemini 3.6 Flash (medium)Google220,0040,0040,00$0.2238.177
19GPT-5.6 Sol (xhigh)OpenAI220,0040,0040,00$0.2217.227
20GPT-5.6 Sol (high)OpenAI220,0040,0040,00$0.2317.358
21Gemini 3.1 Pro (low)Google220,0040,0040,00$0.2429.282
22Gemini 3.6 Flash (high)Google220,0040,0040,00$0.2643.512
23Gemini 3.1 Pro (medium)Google220,0040,0040,00$0.3235.421
24Thinky Inkling (max)Thinking Machines Lab220,0040,0040,00$0.3594.874
25Gemini 3.1 Pro (high)Google220,0040,0040,00$0.4445.995
26Claude Opus 5 (xhigh)Anthropic220,0040,0040,00$0.5136.382
27GPT-5.6 Sol (max)OpenAI220,0040,0040,00$0.5929.418
28OpenRouter FusionOpenRouter220,0040,0040,00$1.0882.188
29Thinky Inkling (minimal)Thinking Machines Lab216,2538,7538,75$0.0315.541
30Tencent Hy3 (low)Tencent216,2538,7538,75≈$0.0351.014
31MiMo V2.5 ProXiaomi216,2538,7538,75$0.0344.821
32GPT-5.6 Terra (medium)OpenAI216,2538,7538,75$0.0417.072
33MiniMax M3MiniMax216,2538,7538,75$0.0558.573
34Claude Sonnet 5 (medium)Anthropic216,2538,7538,75$0.0520.809
35Claude Opus 5 (low)Anthropic216,2538,7538,75$0.1321.079
36Thinky Inkling (high)Thinking Machines Lab216,2538,7538,75$0.1545.984
37Grok 4.5 (low)xAI216,2538,7538,75$0.1641.491
38Claude Opus 5 (medium)Anthropic216,2538,7538,75$0.1823.263
39Claude Sonnet 5 (xhigh)Anthropic216,2538,7538,75$0.1834.416
40Grok 4.5 (medium)xAI216,2538,7538,75$0.2251.145
41Claude Fable 5 (low)Anthropic216,2538,7538,75$0.2420.751
42Grok 4.5 (high)xAI216,2538,7538,75$0.2556.110
43Kimi K3 (low)Moonshot AI216,2538,7538,75$0.2930.082
44Qwen3.7 MaxAlibaba Qwen216,2538,7538,75$0.3381.986
45Claude Opus 5 (high)Anthropic216,2538,7538,75$0.3730.701
46Claude Opus 5 (max)Anthropic216,2538,7538,75$0.6642.252
47Claude Sonnet 5 (max)Anthropic216,2538,7538,75$0.6783.400
48Kimi K3 (max)Moonshot AI216,2538,7538,75$0.9259.915
49Claude Fable 5 (xhigh)Anthropic216,2538,7538,75$1.3342.643
50Claude Fable 5 (max)Anthropic216,2538,7538,75$2.2059.971
51Tencent Hy3 (none)Tencent212,5037,5037,50≈$0.0123.586
52Claude Sonnet 5 (low)Anthropic212,5037,5037,50$0.0420.426
53Muse Glimmer 30B (high)Meta212,5037,5037,50$0.0544.781
54Qwen3.7 PlusAlibaba Qwen212,5037,5037,50$0.0871.574
55Tencent Hy3 (high)Tencent212,5037,5037,50≈$0.10135.411
56Qwen3.6 27BAlibaba Qwen212,5037,5037,50≈$0.2683.525
57Claude Fable 5 (medium)Anthropic212,5037,5037,50$0.3823.703
58Kimi K3 (high)Moonshot AI212,5037,5037,50$0.7048.047
59Claude Fable 5 (high)Anthropic212,5037,5037,50$0.8332.574
60GPT-5.6 Luna (none)OpenAI208,7536,2536,25$0.0015.126
61Gemma 4 31BGoogle208,7536,2536,25≈$0.0128.607
62GPT-5.6 Terra (none)OpenAI208,7536,2536,25$0.0213.027
63Thinky Inkling (none)Thinking Machines Lab208,7536,2536,25$0.0317.113
64GLM 5.2 (high)Z.ai208,7536,2536,25≈$0.1139.976
65Nemotron 3 Ultra (high)NVIDIA208,7536,2536,25$0.71208.050
66DeepSeek V4 Pro (high)DeepSeek205,0035,0035,00≈$0.1449.318
67GLM 5.2 (xhigh)Z.ai205,0035,0035,00≈$0.2064.084
68DeepSeek V4 Pro (xhigh)DeepSeek205,0035,0035,00≈$0.37118.955
69Nemotron 3 Ultra (medium)NVIDIA205,0035,0035,00$0.68198.983
70DeepSeek V4 Flash (high)DeepSeek201,2533,7533,75$0.0141.849
71DeepSeek V4 Flash (xhigh)DeepSeek201,2533,7533,75$0.0159.764
72LongCat 2.0Meituan201,2533,7533,75$0.07209.287
73Ring-2.6-1T (high)Inclusion AI197,5032,5032,50$0.0252.492
74Ring-2.6-1T (xhigh)Inclusion AI186,2528,7528,75$0.0264.065

Cevap kâğıdı

dolgu = soruyu doğru çözen model oranı
  • 1SB2-1: 74 modelin 74 tanesi doğru çözdü
  • 2SB2-2: 74 modelin 73 tanesi doğru çözdü
  • 3SB2-3: 74 modelin 74 tanesi doğru çözdü
  • 4SB2-4: 74 modelin 72 tanesi doğru çözdü
  • 5SB2-5: 74 modelin 73 tanesi doğru çözdü
  • 6SB2-6: 74 modelin 72 tanesi doğru çözdü
  • 7SB2-7: 74 modelin 74 tanesi doğru çözdü
  • 8SB2-8: 74 modelin 74 tanesi doğru çözdü
  • 9SB2-9: 74 modelin 74 tanesi doğru çözdü
  • 10SB2-10: 74 modelin 73 tanesi doğru çözdü
  • 11SB2-11: 74 modelin 73 tanesi doğru çözdü
  • 12SB2-12: 74 modelin 68 tanesi doğru çözdü
  • 13SB2-13: 74 modelin 74 tanesi doğru çözdü
  • 14SB2-14: 74 modelin 72 tanesi doğru çözdü
  • 15SB2-15: 74 modelin 62 tanesi doğru çözdü
  • 16SB2-16: 74 modelin 74 tanesi doğru çözdü
  • 17SB2-17: 74 modelin 74 tanesi doğru çözdü
  • 18SB2-18: 74 modelin 70 tanesi doğru çözdü
  • 19SB2-19: 74 modelin 73 tanesi doğru çözdü
  • 20SB2-20: 74 modelin 71 tanesi doğru çözdü
  • 21SB2-21: 74 modelin 74 tanesi doğru çözdü
  • 22SB2-22: 74 modelin 73 tanesi doğru çözdü
  • 23SB2-23: 74 modelin 74 tanesi doğru çözdü
  • 24SB2-24: 74 modelin 74 tanesi doğru çözdü
  • 25SB2-25: 74 modelin 74 tanesi doğru çözdü
  • 26SB2-26: 74 modelin 73 tanesi doğru çözdü
  • 27SB2-27: 74 modelin 74 tanesi doğru çözdü
  • 28SB2-28: 74 modelin 73 tanesi doğru çözdü
  • 29SB2-29: 74 modelin 72 tanesi doğru çözdü
  • 30SB2-30: 74 modelin 61 tanesi doğru çözdü
  • 31SB2-31: 74 modelin 56 tanesi doğru çözdü
  • 32SB2-32: 74 modelin 73 tanesi doğru çözdü
  • 33SB2-33: 74 modelin 45 tanesi doğru çözdü
  • 34SB2-34: 74 modelin 74 tanesi doğru çözdü
  • 35SB2-35: 74 modelin 73 tanesi doğru çözdü
  • 36SB2-36: 74 modelin 73 tanesi doğru çözdü
  • 37SB2-37: 74 modelin 74 tanesi doğru çözdü
  • 38SB2-38: 74 modelin 74 tanesi doğru çözdü
  • 39SB2-39: 74 modelin 74 tanesi doğru çözdü
  • 40SB2-40: 74 modelin 74 tanesi doğru çözdü
herkes çözdü (18 soru) ayırt eden soru

Koşudan çıkanlar

Üç bulgu

  • Bulgu · Zirve

    Aynı zirve, farklı maliyet

    GPT-5.6 Luna (low), GPT-5.6 Luna (medium), GPT-5.6 Luna (high) ve 25 yapılandırma daha, 220,00 puanla zirveyi paylaşıyor. Zirve grubundaki ölçülen maliyet $0.00 (GPT-5.6 Luna (low)) ile $1.08 (OpenRouter Fusion) arasında.

  • Bulgu · Bölümler

    Tam net tablosu

    Sosyal Bilimler-2 bölümünde tam nete ulaşan model: 28/74.

  • Bulgu · Ölçüm sınırı

    Bilinmeyen değer, sıfır değildir

    Toplam 9 modelde en az bir ölçüm açıklaması var. Maliyet: 9 yaklaşık.

Okuma notları

Kapsam ve ölçüm sınırları

  • Puanlama: net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Sosyal Bilimler-2 neti × 3
  • Sıralama: Yuvarlanmamış puan yüksekten düşüğe sıralanır. Eşit puanda bilinen daha düşük maliyet önce gelir; maliyeti bilinmeyenler aynı puan grubunun sonuna gider. Tam eşitlikte kaynak sırası korunur.
  • 0 modelin maliyeti bilinmediği için maliyet analizlerinden çıkarılır; 9 modelin maliyeti yaklaşık değer taşır.
  • Model notları:
    • Tencent Hy3 (low): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • Tencent Hy3 (none): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • Muse Glimmer 30B (high): Koşu ayarlarındaki 65.536 istenen tavandır; efektif tavan 32.768'dir. Diğer varyantlar 131.072 ile koştu, ancak modelin bağlamı 131.072 olduğundan genel tavan gönderilemezdi. Pinlenen Together endpoint'i ilan etmediği bir sınırla talebi 32.768'de kesiyor. 2026-08-12 ölçümünde bu tavanda hiçbir yanıt kesilmedi.
    • Tencent Hy3 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • Qwen3.6 27B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,8 katıydı.
    • Gemma 4 31B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,2 katıydı.
    • GLM 5.2 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
    • DeepSeek V4 Pro (high): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
    • GLM 5.2 (xhigh): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
    • DeepSeek V4 Pro (xhigh): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.