2026 AYT · Türk Dili ve Edebiyatı - Sosyal Bilimler-1

Yöntem notları

net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Türk Dili ve Edebiyatı - Sosyal Bilimler-1 neti × 3

Lider model
Thinky Inkling (high)220,00TDE-SB1 Puanı
Model
74
Soru
40
Model–soru yanıtı
2.960
Ölçülen toplam maliyet
≈$21.73
Koşu tarihi
31 Temmuz 2026
SıraModelTDE-SB1 PuanıNetMaliyetToken
#1Thinky Inkling (high)220,0040,00$0.1954.882
#2Claude Opus 5 (medium)220,0040,00$0.2325.139
#3GPT-5.6 Sol (high)220,0040,00$0.2919.233
#4Gemini 3.1 Pro (medium)220,0040,00$0.3740.073
#5Claude Opus 5 (xhigh)220,0040,00$0.5839.188

Tüm benchmark analizi

Tüm sonuçlar

Liderlik tablosu

Başlıkları seçerek sıralamayı değiştirebilirsiniz; bilinmeyen değerler her zaman sona gider.

Model
1Thinky Inkling (high)Thinking Machines Lab220,0040,0040,00$0.1954.882
2Claude Opus 5 (medium)Anthropic220,0040,0040,00$0.2325.139
3GPT-5.6 Sol (high)OpenAI220,0040,0040,00$0.2919.233
4Gemini 3.1 Pro (medium)Google220,0040,0040,00$0.3740.073
5Claude Opus 5 (xhigh)Anthropic220,0040,0040,00$0.5839.188
6Claude Opus 5 (max)Anthropic220,0040,0040,00$0.9051.735
7OpenRouter FusionOpenRouter220,0040,0040,00n/a87.048
8GPT-5.6 Terra (low)OpenAI216,2538,7538,75$0.0315.500
9DeepSeek V4 Pro (xhigh)DeepSeek216,2538,7538,75≈$0.0572.405
10Gemini 3.6 Flash (low)Google216,2538,7538,75$0.1326.109
11GPT-5.6 Sol (none)OpenAI216,2538,7538,75$0.1514.643
12Claude Opus 5 (low)Anthropic216,2538,7538,75$0.1521.890
13GPT-5.6 Sol (low)OpenAI216,2538,7538,75$0.2116.599
14GPT-5.6 Sol (medium)OpenAI216,2538,7538,75$0.2417.543
15Gemini 3.6 Flash (medium)Google216,2538,7538,75$0.2542.239
16Claude Fable 5 (low)Anthropic216,2538,7538,75$0.2520.971
17Gemini 3.1 Pro (low)Google216,2538,7538,75$0.2630.521
18GPT-5.6 Sol (xhigh)OpenAI216,2538,7538,75$0.2819.074
19Thinky Inkling (max)Thinking Machines Lab216,2538,7538,75$0.2878.646
20Gemini 3.6 Flash (high)Google216,2538,7538,75$0.3048.145
21Claude Fable 5 (medium)Anthropic216,2538,7538,75$0.4925.785
22Claude Fable 5 (high)Anthropic216,2538,7538,75$0.9134.207
23Gemini 3.1 Pro (high)Google216,2538,7538,75$1.40125.331
24Claude Fable 5 (xhigh)Anthropic216,2538,7538,75$1.4645.110
25Claude Fable 5 (max)Anthropic216,2538,7538,75$2.6969.640
26GPT-5.6 Luna (medium)OpenAI212,5037,5037,50$0.0120.290
27DeepSeek V4 Pro (high)DeepSeek212,5037,5037,50≈$0.0452.598
28GPT-5.6 Terra (high)OpenAI212,5037,5037,50$0.0417.010
29Tencent Hy3 (high)Tencent212,5037,5037,50≈$0.06132.488
30Thinky Inkling (medium)Thinking Machines Lab212,5037,5037,50$0.0725.333
31Gemini 3.6 Flash (minimal)Google212,5037,5037,50$0.0819.080
32GPT-5.6 Terra (max)OpenAI212,5037,5037,50$0.1331.887
33Grok 4.5 (high)xAI212,5037,5037,50$0.3164.526
34Qwen3.7 MaxAlibaba Qwen212,5037,5037,50$0.3484.433
35GPT-5.6 Sol (max)OpenAI212,5037,5037,50$0.4825.679
36Claude Opus 5 (high)Anthropic212,5037,5037,50$0.5437.535
37GPT-5.6 Luna (low)OpenAI208,7536,2536,25$0.0118.702
38GPT-5.6 Luna (high)OpenAI208,7536,2536,25$0.0124.027
39GPT-5.6 Luna (max)OpenAI208,7536,2536,25$0.0237.930
40GPT-5.6 Luna (xhigh)OpenAI208,7536,2536,25$0.0238.943
41GPT-5.6 Terra (medium)OpenAI208,7536,2536,25$0.0517.799
42DeepSeek V4 Flash (high)DeepSeek208,7536,2536,25$0.05184.542
43Claude Sonnet 5 (high)Anthropic208,7536,2536,25$0.1227.510
44Grok 4.5 (medium)xAI208,7536,2536,25$0.3063.441
45Kimi K3 (low)Moonshot AI208,7536,2536,25$0.3135.353
46Kimi K3 (high)Moonshot AI208,7536,2536,25$0.6558.749
47Kimi K3 (max)Moonshot AI208,7536,2536,25$0.7665.484
48GPT-5.6 Luna (none)OpenAI205,0035,0035,00$0.0015.111
49GPT-5.6 Terra (none)OpenAI205,0035,0035,00$0.0212.602
50Tencent Hy3 (low)Tencent205,0035,0035,00≈$0.0358.234
51Thinky Inkling (low)Thinking Machines Lab205,0035,0035,00$0.0315.190
52MiniMax M3MiniMax205,0035,0035,00$0.0663.373
53GPT-5.6 Terra (xhigh)OpenAI205,0035,0035,00$0.0822.808
54Qwen3.7 PlusAlibaba Qwen205,0035,0035,00$0.13113.402
55Grok 4.5 (low)xAI205,0035,0035,00$0.2148.304
56Claude Sonnet 5 (xhigh)Anthropic205,0035,0035,00$0.2439.590
57GLM 5.2 (xhigh)Z.ai205,0035,0035,00≈$0.64189.916
58Claude Sonnet 5 (max)Anthropic205,0035,0035,00$0.6782.824
59GLM 5.2 (high)Z.ai205,0035,0035,00≈$0.89261.300
60Gemma 4 31BGoogle201,2533,7533,75≈$0.0128.440
61Thinky Inkling (minimal)Thinking Machines Lab201,2533,7533,75$0.0215.097
62Thinky Inkling (none)Thinking Machines Lab201,2533,7533,75$0.0317.498
63MiMo V2.5 ProXiaomi201,2533,7533,75$0.17203.953
64Nemotron 3 Ultra (high)NVIDIA201,2533,7533,75$0.36111.882
65Nemotron 3 Ultra (medium)NVIDIA201,2533,7533,75$0.39119.825
66Tencent Hy3 (none)Tencent197,5032,5032,50≈$0.0124.127
67DeepSeek V4 Flash (xhigh)DeepSeek197,5032,5032,50$0.20723.130
68Muse Glimmer 30B (high)Meta193,7531,2531,25$0.0758.523
69Claude Sonnet 5 (low)Anthropic190,0030,0030,00$0.0520.492
70Claude Sonnet 5 (medium)Anthropic190,0030,0030,00$0.0622.047
71Qwen3.6 27BAlibaba Qwen190,0030,0030,00≈$0.20108.630
72LongCat 2.0Meituan186,2528,7528,75$0.51440.056
73Ring-2.6-1T (xhigh)Inclusion AI182,5027,5027,50$0.11185.984
74Ring-2.6-1T (high)Inclusion AI178,7526,2526,25$0.08136.358

Cevap kâğıdı

dolgu = soruyu doğru çözen model oranı
  • 1TDE-SB1-1: 74 modelin 74 tanesi doğru çözdü
  • 2TDE-SB1-2: 74 modelin 73 tanesi doğru çözdü
  • 3TDE-SB1-3: 74 modelin 73 tanesi doğru çözdü
  • 4TDE-SB1-4: 74 modelin 73 tanesi doğru çözdü
  • 5TDE-SB1-5: 74 modelin 74 tanesi doğru çözdü
  • 6TDE-SB1-6: 74 modelin 25 tanesi doğru çözdü
  • 7TDE-SB1-7: 74 modelin 71 tanesi doğru çözdü
  • 8TDE-SB1-8: 74 modelin 65 tanesi doğru çözdü
  • 9TDE-SB1-9: 74 modelin 72 tanesi doğru çözdü
  • 10TDE-SB1-10: 74 modelin 73 tanesi doğru çözdü
  • 11TDE-SB1-11: 74 modelin 71 tanesi doğru çözdü
  • 12TDE-SB1-12: 74 modelin 74 tanesi doğru çözdü
  • 13TDE-SB1-13: 74 modelin 59 tanesi doğru çözdü
  • 14TDE-SB1-14: 74 modelin 72 tanesi doğru çözdü
  • 15TDE-SB1-15: 74 modelin 61 tanesi doğru çözdü
  • 16TDE-SB1-16: 74 modelin 73 tanesi doğru çözdü
  • 17TDE-SB1-17: 74 modelin 74 tanesi doğru çözdü
  • 18TDE-SB1-18: 74 modelin 67 tanesi doğru çözdü
  • 19TDE-SB1-19: 74 modelin 52 tanesi doğru çözdü
  • 20TDE-SB1-20: 74 modelin 49 tanesi doğru çözdü
  • 21TDE-SB1-21: 74 modelin 71 tanesi doğru çözdü
  • 22TDE-SB1-22: 74 modelin 70 tanesi doğru çözdü
  • 23TDE-SB1-23: 74 modelin 42 tanesi doğru çözdü
  • 24TDE-SB1-24: 74 modelin 74 tanesi doğru çözdü
  • 25TDE-SB1-25: 74 modelin 74 tanesi doğru çözdü
  • 26TDE-SB1-26: 74 modelin 74 tanesi doğru çözdü
  • 27TDE-SB1-27: 74 modelin 74 tanesi doğru çözdü
  • 28TDE-SB1-28: 74 modelin 74 tanesi doğru çözdü
  • 29TDE-SB1-29: 74 modelin 70 tanesi doğru çözdü
  • 30TDE-SB1-30: 74 modelin 74 tanesi doğru çözdü
  • 31TDE-SB1-31: 74 modelin 68 tanesi doğru çözdü
  • 32TDE-SB1-32: 74 modelin 69 tanesi doğru çözdü
  • 33TDE-SB1-33: 74 modelin 71 tanesi doğru çözdü
  • 34TDE-SB1-34: 74 modelin 72 tanesi doğru çözdü
  • 35TDE-SB1-35: 74 modelin 69 tanesi doğru çözdü
  • 36TDE-SB1-36: 74 modelin 73 tanesi doğru çözdü
  • 37TDE-SB1-37: 74 modelin 72 tanesi doğru çözdü
  • 38TDE-SB1-38: 74 modelin 72 tanesi doğru çözdü
  • 39TDE-SB1-39: 74 modelin 74 tanesi doğru çözdü
  • 40TDE-SB1-40: 74 modelin 74 tanesi doğru çözdü
herkes çözdü (12 soru) ayırt eden soru

Koşudan çıkanlar

Üç bulgu

  • Bulgu · Zirve

    Aynı zirve, farklı maliyet

    Thinky Inkling (high), Claude Opus 5 (medium), GPT-5.6 Sol (high) ve 4 yapılandırma daha, 220,00 puanla zirveyi paylaşıyor. Zirve grubundaki ölçülen maliyet $0.19 (Thinky Inkling (high)) ile $0.90 (Claude Opus 5 (max)) arasında. Ayrıca zirvedeki 1 modelin maliyeti bilinmiyor.

  • Bulgu · Bölümler

    Tam net tablosu

    Türk Dili ve Edebiyatı - Sosyal Bilimler-1 bölümünde tam nete ulaşan model: 7/74.

  • Bulgu · Ölçüm sınırı

    Bilinmeyen değer, sıfır değildir

    Toplam 10 modelde en az bir ölçüm açıklaması var. Maliyet: 1 bilinmiyor, 9 yaklaşık.

Okuma notları

Kapsam ve ölçüm sınırları

  • Puanlama: net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Türk Dili ve Edebiyatı - Sosyal Bilimler-1 neti × 3
  • Sıralama: Yuvarlanmamış puan yüksekten düşüğe sıralanır. Eşit puanda bilinen daha düşük maliyet önce gelir; maliyeti bilinmeyenler aynı puan grubunun sonuna gider. Tam eşitlikte kaynak sırası korunur.
  • 1 modelin maliyeti bilinmediği için maliyet analizlerinden çıkarılır; 9 modelin maliyeti yaklaşık değer taşır.
  • Model notları:
    • DeepSeek V4 Pro (xhigh): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
    • DeepSeek V4 Pro (high): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
    • Tencent Hy3 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • Tencent Hy3 (low): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • GLM 5.2 (xhigh): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
    • GLM 5.2 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
    • Gemma 4 31B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,2 katıydı.
    • Tencent Hy3 (none): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • Muse Glimmer 30B (high): Koşu ayarlarındaki 65.536 istenen tavandır; efektif tavan 32.768'dir. Diğer varyantlar 131.072 ile koştu, ancak modelin bağlamı 131.072 olduğundan genel tavan gönderilemezdi. Pinlenen Together endpoint'i ilan etmediği bir sınırla talebi 32.768'de kesiyor. 2026-08-12 ölçümünde bu tavanda hiçbir yanıt kesilmedi.
    • Qwen3.6 27B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,8 katıydı.