2026 AYT · Fen Bilimleri

Yöntem notları

net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Fen Bilimleri neti × 3

Lider model
Gemini 3.6 Flash (minimal)216,25Fen Puanı
Model
74
Soru
40
Model–soru yanıtı
2.960
Ölçülen toplam maliyet
≈$23.57
Koşu tarihi
31 Temmuz 2026
SıraModelFen PuanıNetMaliyetToken
#1Gemini 3.6 Flash (minimal)216,2538,75$0.1326.469
#2Claude Sonnet 5 (medium)216,2538,75$0.1933.370
#3Gemini 3.1 Pro (low)216,2538,75$0.3437.465
#4Qwen3.7 Max216,2538,75$0.3586.803
#5Qwen3.6 27B216,2538,75≈$0.46136.760

Tüm benchmark analizi

Tüm sonuçlar

Liderlik tablosu

Başlıkları seçerek sıralamayı değiştirebilirsiniz; bilinmeyen değerler her zaman sona gider.

Model
1Gemini 3.6 Flash (minimal)Google216,2538,7538,75$0.1326.469
2Claude Sonnet 5 (medium)Anthropic216,2538,7538,75$0.1933.370
3Gemini 3.1 Pro (low)Google216,2538,7538,75$0.3437.465
4Qwen3.7 MaxAlibaba Qwen216,2538,7538,75$0.3586.803
5Qwen3.6 27BAlibaba Qwen216,2538,7538,75≈$0.46136.760
6Gemini 3.1 Pro (medium)Google216,2538,7538,75$0.4949.276
7Thinky Inkling (max)Thinking Machines Lab216,2538,7538,75$0.52137.597
8GPT-5.6 Luna (none)OpenAI212,5037,5037,50$0.0017.269
9GPT-5.6 Luna (low)OpenAI212,5037,5037,50$0.0120.659
10GPT-5.6 Luna (high)OpenAI212,5037,5037,50$0.0123.643
11GPT-5.6 Luna (xhigh)OpenAI212,5037,5037,50$0.0127.879
12GPT-5.6 Luna (max)OpenAI212,5037,5037,50$0.0355.035
13Tencent Hy3 (low)Tencent212,5037,5037,50≈$0.0461.855
14GPT-5.6 Terra (low)OpenAI212,5037,5037,50$0.0518.318
15GPT-5.6 Terra (medium)OpenAI212,5037,5037,50$0.0618.870
16GPT-5.6 Terra (high)OpenAI212,5037,5037,50$0.0720.270
17Claude Sonnet 5 (low)Anthropic212,5037,5037,50$0.0721.680
18GPT-5.6 Terra (xhigh)OpenAI212,5037,5037,50$0.0821.904
19Qwen3.7 PlusAlibaba Qwen212,5037,5037,50$0.0980.273
20Tencent Hy3 (high)Tencent212,5037,5037,50≈$0.12162.505
21Claude Opus 5 (low)Anthropic212,5037,5037,50$0.1721.427
22GPT-5.6 Terra (max)OpenAI212,5037,5037,50$0.1738.309
23Grok 4.5 (low)xAI212,5037,5037,50$0.1843.763
24GPT-5.6 Sol (none)OpenAI212,5037,5037,50$0.2016.076
25Gemini 3.6 Flash (low)Google212,5037,5037,50$0.2035.638
26GPT-5.6 Sol (low)OpenAI212,5037,5037,50$0.2818.765
27GLM 5.2 (high)Z.ai212,5037,5037,50≈$0.3053.096
28Claude Opus 5 (medium)Anthropic212,5037,5037,50$0.3026.689
29GPT-5.6 Sol (medium)OpenAI212,5037,5037,50$0.3119.540
30Gemini 3.6 Flash (medium)Google212,5037,5037,50$0.3454.483
31Grok 4.5 (medium)xAI212,5037,5037,50$0.3572.339
32Grok 4.5 (high)xAI212,5037,5037,50$0.3572.507
33GPT-5.6 Sol (high)OpenAI212,5037,5037,50$0.3621.464
34GPT-5.6 Sol (xhigh)OpenAI212,5037,5037,50$0.3721.611
35Gemini 3.6 Flash (high)Google212,5037,5037,50$0.4264.122
36Claude Opus 5 (high)Anthropic212,5037,5037,50$0.4833.866
37GPT-5.6 Sol (max)OpenAI212,5037,5037,50$0.4925.629
38Claude Opus 5 (xhigh)Anthropic212,5037,5037,50$0.5436.168
39OpenRouter FusionOpenRouter212,5037,5037,50$0.6668.322
40Claude Opus 5 (max)Anthropic212,5037,5037,50$0.6841.704
41Gemini 3.1 Pro (high)Google212,5037,5037,50$0.7470.816
42GPT-5.6 Luna (medium)OpenAI208,7536,2536,25$0.0121.692
43Gemma 4 31BGoogle208,7536,2536,25≈$0.0131.213
44Tencent Hy3 (none)Tencent208,7536,2536,25≈$0.0123.803
45DeepSeek V4 Flash (high)DeepSeek208,7536,2536,25$0.0264.104
46Ring-2.6-1T (high)Inclusion AI208,7536,2536,25$0.0247.308
47Thinky Inkling (minimal)Thinking Machines Lab208,7536,2536,25$0.0417.848
48Thinky Inkling (medium)Thinking Machines Lab208,7536,2536,25$0.0930.362
49LongCat 2.0Meituan208,7536,2536,25$0.17148.737
50Nemotron 3 Ultra (medium)NVIDIA208,7536,2536,25$0.2683.072
51DeepSeek V4 Pro (high)DeepSeek208,7536,2536,25≈$0.2785.664
52Thinky Inkling (high)Thinking Machines Lab208,7536,2536,25$0.2981.384
53Nemotron 3 Ultra (high)NVIDIA208,7536,2536,25$0.3298.620
54Claude Sonnet 5 (high)Anthropic208,7536,2536,25$0.3347.598
55Kimi K3 (low)Moonshot AI208,7536,2536,25$0.4436.445
56Claude Sonnet 5 (xhigh)Anthropic208,7536,2536,25$0.5367.145
57Kimi K3 (high)Moonshot AI208,7536,2536,25$0.8155.096
58Kimi K3 (max)Moonshot AI208,7536,2536,25$1.2170.615
59GLM 5.2 (xhigh)Z.ai208,7536,2536,25≈$1.55247.730
60Claude Sonnet 5 (max)Anthropic208,7536,2536,25$1.70184.631
61DeepSeek V4 Flash (xhigh)DeepSeek205,0035,0035,00$0.04140.227
62Thinky Inkling (low)Thinking Machines Lab205,0035,0035,00$0.0417.822
63Ring-2.6-1T (xhigh)Inclusion AI205,0035,0035,00$0.06139.254
64Muse Glimmer 30B (high)Meta205,0035,0035,00$0.0756.822
65DeepSeek V4 Pro (xhigh)DeepSeek205,0035,0035,00≈$0.50157.629
66GPT-5.6 Terra (none)OpenAI201,2533,7533,75$0.0314.583
67MiMo V2.5 ProXiaomi201,2533,7533,75$0.0559.996
68Thinky Inkling (none)Thinking Machines Lab197,5032,5032,50$0.0418.908
69MiniMax M3MiniMax190,0030,0030,00$0.0296.652
70Claude Fable 5 (low)Anthropic171,2523,7523,75$0.2219.926
71Claude Fable 5 (medium)Anthropic171,2523,7523,75$0.4424.388
72Claude Fable 5 (high)Anthropic171,2523,7523,75$0.6528.648
73Claude Fable 5 (xhigh)Anthropic171,2523,7523,75$0.9835.249
74Claude Fable 5 (max)Anthropic171,2523,7523,75$1.3743.087

Cevap kâğıdı

dolgu = soruyu doğru çözen model oranı
  • 1FEN-1: 74 modelin 69 tanesi doğru çözdü
  • 2FEN-2: 74 modelin 73 tanesi doğru çözdü
  • 3FEN-3: 74 modelin 74 tanesi doğru çözdü
  • 4FEN-4: 74 modelin 74 tanesi doğru çözdü
  • 5FEN-5: 74 modelin 71 tanesi doğru çözdü
  • 6FEN-6: 74 modelin 73 tanesi doğru çözdü
  • 7FEN-7: 74 modelin 74 tanesi doğru çözdü
  • 8FEN-8: 74 modelin 74 tanesi doğru çözdü
  • 9FEN-9: 74 modelin 74 tanesi doğru çözdü
  • 10FEN-10: 74 modelin 73 tanesi doğru çözdü
  • 11FEN-11: 74 modelin 70 tanesi doğru çözdü
  • 12FEN-12: 74 modelin 74 tanesi doğru çözdü
  • 13FEN-13: 74 modelin 71 tanesi doğru çözdü
  • 14FEN-14: 74 modelin 73 tanesi doğru çözdü
  • 15FEN-15: 74 modelin 71 tanesi doğru çözdü
  • 16FEN-16: 74 modelin 74 tanesi doğru çözdü
  • 17FEN-17: 74 modelin 74 tanesi doğru çözdü
  • 18FEN-18: 74 modelin 73 tanesi doğru çözdü
  • 19FEN-19: 74 modelin 74 tanesi doğru çözdü
  • 20FEN-20: 74 modelin 74 tanesi doğru çözdü
  • 21FEN-21: 74 modelin 74 tanesi doğru çözdü
  • 22FEN-22: 74 modelin 74 tanesi doğru çözdü
  • 23FEN-23: 74 modelin 73 tanesi doğru çözdü
  • 24FEN-24: 74 modelin 74 tanesi doğru çözdü
  • 25FEN-25: 74 modelin 74 tanesi doğru çözdü
  • 26FEN-26: 74 modelin 73 tanesi doğru çözdü
  • 27FEN-27: 74 modelin 74 tanesi doğru çözdü
  • 28FEN-28: 74 modelin 69 tanesi doğru çözdü
  • 29FEN-29: 74 modelin 69 tanesi doğru çözdü
  • 30FEN-30: 74 modelin 69 tanesi doğru çözdü
  • 31FEN-31: 74 modelin 69 tanesi doğru çözdü
  • 32FEN-32: 74 modelin 69 tanesi doğru çözdü
  • 33FEN-33: 74 modelin 69 tanesi doğru çözdü
  • 34FEN-34: 74 modelin 69 tanesi doğru çözdü
  • 35FEN-35: 74 modelin 69 tanesi doğru çözdü
  • 36FEN-36: 74 modelin 8 tanesi doğru çözdü
  • 37FEN-37: 74 modelin 1 tanesi doğru çözdü
  • 38FEN-38: 74 modelin 68 tanesi doğru çözdü
  • 39FEN-39: 74 modelin 68 tanesi doğru çözdü
  • 40FEN-40: 74 modelin 49 tanesi doğru çözdü
herkes çözdü (15 soru) ayırt eden soru

Koşudan çıkanlar

Üç bulgu

  • Bulgu · Zirve

    Aynı zirve, farklı maliyet

    Gemini 3.6 Flash (minimal), Claude Sonnet 5 (medium), Gemini 3.1 Pro (low) ve 4 yapılandırma daha, 216,25 puanla zirveyi paylaşıyor. Zirve grubundaki ölçülen maliyet $0.13 (Gemini 3.6 Flash (minimal)) ile $0.52 (Thinky Inkling (max)) arasında.

  • Bulgu · Bölümler

    Tam net tablosu

    Fen Bilimleri bölümünde tam nete ulaşan model: 0/74.

  • Bulgu · Ölçüm sınırı

    Bilinmeyen değer, sıfır değildir

    Toplam 9 modelde en az bir ölçüm açıklaması var. Maliyet: 9 yaklaşık.

Okuma notları

Kapsam ve ölçüm sınırları

  • Puanlama: net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Fen Bilimleri neti × 3
  • Sıralama: Yuvarlanmamış puan yüksekten düşüğe sıralanır. Eşit puanda bilinen daha düşük maliyet önce gelir; maliyeti bilinmeyenler aynı puan grubunun sonuna gider. Tam eşitlikte kaynak sırası korunur.
  • 0 modelin maliyeti bilinmediği için maliyet analizlerinden çıkarılır; 9 modelin maliyeti yaklaşık değer taşır.
  • Model notları:
    • Qwen3.6 27B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,8 katıydı.
    • Tencent Hy3 (low): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • Tencent Hy3 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • GLM 5.2 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
    • Gemma 4 31B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,2 katıydı.
    • Tencent Hy3 (none): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
    • DeepSeek V4 Pro (high): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
    • GLM 5.2 (xhigh): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
    • Muse Glimmer 30B (high): Koşu ayarlarındaki 65.536 istenen tavandır; efektif tavan 32.768'dir. Diğer varyantlar 131.072 ile koştu, ancak modelin bağlamı 131.072 olduğundan genel tavan gönderilemezdi. Pinlenen Together endpoint'i ilan etmediği bir sınırla talebi 32.768'de kesiyor. 2026-08-12 ölçümünde bu tavanda hiçbir yanıt kesilmedi.
    • DeepSeek V4 Pro (xhigh): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
    • Claude Fable 5 (low): 40 sorunun 13'ünde (biyoloji) sağlayıcı içerik filtresi yanıtı engelledi; model bu sorulara hiç girmedi. Bu bölümdeki net, modelin bilgisini değil filtre davranışını yansıtır.
    • Claude Fable 5 (medium): 40 sorunun 13'ünde (biyoloji) sağlayıcı içerik filtresi yanıtı engelledi; model bu sorulara hiç girmedi. Bu bölümdeki net, modelin bilgisini değil filtre davranışını yansıtır.
    • Claude Fable 5 (high): 40 sorunun 13'ünde (biyoloji) sağlayıcı içerik filtresi yanıtı engelledi; model bu sorulara hiç girmedi. Bu bölümdeki net, modelin bilgisini değil filtre davranışını yansıtır.
    • Claude Fable 5 (xhigh): 40 sorunun 13'ünde (biyoloji) sağlayıcı içerik filtresi yanıtı engelledi; model bu sorulara hiç girmedi. Bu bölümdeki net, modelin bilgisini değil filtre davranışını yansıtır.
    • Claude Fable 5 (max): 40 sorunun 13'ünde (biyoloji) sağlayıcı içerik filtresi yanıtı engelledi; model bu sorulara hiç girmedi. Bu bölümdeki net, modelin bilgisini değil filtre davranışını yansıtır.