2026 AYT · Matematik
Yöntem notlarınet = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Matematik neti × 3
- Lider model
- GPT-5.6 Luna (xhigh)213,25Matematik Puanı
- Model
- 74
- Soru
- 39
- Model–soru yanıtı
- 2.886
- Ölçülen toplam maliyet
- ≈$44.47
- Koşu tarihi
- 31 Temmuz 2026
İlk 5 model
Tüm sonuçları gör| Sıra | Model | Matematik Puanı | Net | Maliyet | Token |
|---|---|---|---|---|---|
| #1 | GPT-5.6 Luna (xhigh) | 213,25 | 37,75 | $0.04 | 69.598 |
| #2 | GPT-5.6 Luna (max) | 213,25 | 37,75 | $0.04 | 76.098 |
| #3 | Ring-2.6-1T (high) | 213,25 | 37,75 | $0.04 | 77.168 |
| #4 | Ring-2.6-1T (xhigh) | 213,25 | 37,75 | $0.06 | 105.773 |
| #5 | GPT-5.6 Terra (low) | 213,25 | 37,75 | $0.10 | 24.333 |
Tüm benchmark analizi
Tüm sonuçlar
Liderlik tablosu
Başlıkları seçerek sıralamayı değiştirebilirsiniz; bilinmeyen değerler her zaman sona gider.
| Model | |||||||
|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Luna (xhigh)OpenAI | 213,25 | 37,75 | 37,75 | $0.04 | 69.598 | |
| 2 | GPT-5.6 Luna (max)OpenAI | 213,25 | 37,75 | 37,75 | $0.04 | 76.098 | |
| 3 | Ring-2.6-1T (high)Inclusion AI | 213,25 | 37,75 | 37,75 | $0.04 | 77.168 | |
| 4 | Ring-2.6-1T (xhigh)Inclusion AI | 213,25 | 37,75 | 37,75 | $0.06 | 105.773 | |
| 5 | GPT-5.6 Terra (low)OpenAI | 213,25 | 37,75 | 37,75 | $0.10 | 24.333 | |
| 6 | GPT-5.6 Terra (high)OpenAI | 213,25 | 37,75 | 37,75 | $0.11 | 26.749 | |
| 7 | GPT-5.6 Terra (xhigh)OpenAI | 213,25 | 37,75 | 37,75 | $0.14 | 31.086 | |
| 8 | Tencent Hy3 (high)Tencent | 213,25 | 37,75 | 37,75 | ≈$0.15 | 291.328 | |
| 9 | Muse Glimmer 30B (high)Meta | 213,25 | 37,75 | 37,75 | $0.16 | 113.764 | |
| 10 | Thinky Inkling (medium)Thinking Machines Lab | 213,25 | 37,75 | 37,75 | $0.25 | 69.985 | |
| 11 | Qwen3.7 PlusAlibaba Qwen | 213,25 | 37,75 | 37,75 | $0.26 | 209.436 | |
| 12 | Claude Opus 5 (low)Anthropic | 213,25 | 37,75 | 37,75 | $0.31 | 23.735 | |
| 13 | GPT-5.6 Terra (max)OpenAI | 213,25 | 37,75 | 37,75 | $0.33 | 62.695 | |
| 14 | Gemini 3.6 Flash (low)Google | 213,25 | 37,75 | 37,75 | $0.40 | 60.641 | |
| 15 | Claude Opus 5 (medium)Anthropic | 213,25 | 37,75 | 37,75 | $0.47 | 30.188 | |
| 16 | Claude Sonnet 5 (medium)Anthropic | 213,25 | 37,75 | 37,75 | $0.48 | 59.798 | |
| 17 | GPT-5.6 Sol (low)OpenAI | 213,25 | 37,75 | 37,75 | $0.51 | 24.667 | |
| 18 | Grok 4.5 (medium)xAI | 213,25 | 37,75 | 37,75 | $0.52 | 98.216 | |
| 19 | GPT-5.6 Sol (medium)OpenAI | 213,25 | 37,75 | 37,75 | $0.53 | 25.242 | |
| 20 | Claude Fable 5 (low)Anthropic | 213,25 | 37,75 | 37,75 | $0.55 | 22.573 | |
| 21 | Nemotron 3 Ultra (high)NVIDIA | 213,25 | 37,75 | 37,75 | $0.56 | 164.373 | |
| 22 | Nemotron 3 Ultra (medium)NVIDIA | 213,25 | 37,75 | 37,75 | $0.60 | 173.901 | |
| 23 | Grok 4.5 (high)xAI | 213,25 | 37,75 | 37,75 | $0.60 | 111.954 | |
| 24 | Gemini 3.1 Pro (low)Google | 213,25 | 37,75 | 37,75 | $0.61 | 58.350 | |
| 25 | GPT-5.6 Sol (high)OpenAI | 213,25 | 37,75 | 37,75 | $0.65 | 29.338 | |
| 26 | Qwen3.7 MaxAlibaba Qwen | 213,25 | 37,75 | 37,75 | $0.72 | 168.909 | |
| 27 | Thinky Inkling (max)Thinking Machines Lab | 213,25 | 37,75 | 37,75 | $0.73 | 187.437 | |
| 28 | GPT-5.6 Sol (xhigh)OpenAI | 213,25 | 37,75 | 37,75 | $0.73 | 32.011 | |
| 29 | Claude Opus 5 (high)Anthropic | 213,25 | 37,75 | 37,75 | $0.78 | 42.601 | |
| 30 | Claude Sonnet 5 (high)Anthropic | 213,25 | 37,75 | 37,75 | $0.88 | 99.603 | |
| 31 | Gemini 3.6 Flash (high)Google | 213,25 | 37,75 | 37,75 | $0.90 | 127.527 | |
| 32 | Gemini 3.1 Pro (medium)Google | 213,25 | 37,75 | 37,75 | $0.92 | 83.818 | |
| 33 | Claude Opus 5 (xhigh)Anthropic | 213,25 | 37,75 | 37,75 | $0.96 | 49.816 | |
| 34 | Claude Fable 5 (medium)Anthropic | 213,25 | 37,75 | 37,75 | $0.97 | 30.964 | |
| 35 | GPT-5.6 Sol (max)OpenAI | 213,25 | 37,75 | 37,75 | $1.06 | 42.982 | |
| 36 | Claude Sonnet 5 (xhigh)Anthropic | 213,25 | 37,75 | 37,75 | $1.21 | 132.384 | |
| 37 | Claude Opus 5 (max)Anthropic | 213,25 | 37,75 | 37,75 | $1.28 | 62.493 | |
| 38 | Claude Fable 5 (high)Anthropic | 213,25 | 37,75 | 37,75 | $1.41 | 39.748 | |
| 39 | Gemini 3.1 Pro (high)Google | 213,25 | 37,75 | 37,75 | $1.49 | 131.297 | |
| 40 | Claude Fable 5 (xhigh)Anthropic | 213,25 | 37,75 | 37,75 | $2.06 | 52.659 | |
| 41 | Claude Fable 5 (max)Anthropic | 213,25 | 37,75 | 37,75 | $3.34 | 78.199 | |
| 42 | Claude Sonnet 5 (max)Anthropic | 213,25 | 37,75 | 37,75 | $4.06 | 417.489 | |
| 43 | OpenRouter FusionOpenRouter | 213,25 | 37,75 | 37,75 | n/a | 94.666 | |
| 44 | GPT-5.6 Luna (medium)OpenAI | 209,50 | 36,50 | 36,50 | $0.02 | 33.326 | |
| 45 | Tencent Hy3 (low)Tencent | 209,50 | 36,50 | 36,50 | ≈$0.05 | 98.707 | |
| 46 | Thinky Inkling (minimal)Thinking Machines Lab | 209,50 | 36,50 | 36,50 | $0.09 | 29.026 | |
| 47 | MiMo V2.5 ProXiaomi | 209,50 | 36,50 | 36,50 | $0.10 | 116.515 | |
| 48 | DeepSeek V4 Pro (high)DeepSeek | 209,50 | 36,50 | 36,50 | ≈$0.11 | 135.789 | |
| 49 | GPT-5.6 Terra (medium)OpenAI | 209,50 | 36,50 | 36,50 | $0.14 | 30.237 | |
| 50 | DeepSeek V4 Flash (xhigh)DeepSeek | 209,50 | 36,50 | 36,50 | $0.15 | 554.206 | |
| 51 | Gemini 3.6 Flash (minimal)Google | 209,50 | 36,50 | 36,50 | $0.22 | 36.516 | |
| 52 | Claude Sonnet 5 (low)Anthropic | 209,50 | 36,50 | 36,50 | $0.26 | 37.093 | |
| 53 | Grok 4.5 (low)xAI | 209,50 | 36,50 | 36,50 | $0.32 | 65.065 | |
| 54 | Thinky Inkling (high)Thinking Machines Lab | 209,50 | 36,50 | 36,50 | $0.42 | 110.403 | |
| 55 | LongCat 2.0Meituan | 209,50 | 36,50 | 36,50 | $0.43 | 370.865 | |
| 56 | Kimi K3 (low)Moonshot AI | 209,50 | 36,50 | 36,50 | $0.57 | 49.585 | |
| 57 | Kimi K3 (high)Moonshot AI | 209,50 | 36,50 | 36,50 | $0.74 | 61.432 | |
| 58 | Gemini 3.6 Flash (medium)Google | 209,50 | 36,50 | 36,50 | $0.80 | 113.281 | |
| 59 | Gemma 4 31BGoogle | 205,75 | 35,25 | 35,25 | ≈$0.01 | 45.262 | |
| 60 | DeepSeek V4 Pro (xhigh)DeepSeek | 205,75 | 35,25 | 35,25 | ≈$0.23 | 266.260 | |
| 61 | GLM 5.2 (xhigh)Z.ai | 205,75 | 35,25 | 35,25 | ≈$1.47 | 398.849 | |
| 62 | Kimi K3 (max)Moonshot AI | 205,75 | 35,25 | 35,25 | $3.13 | 220.059 | |
| 63 | GPT-5.6 Luna (high)OpenAI | 202,00 | 34,00 | 34,00 | $0.03 | 50.682 | |
| 64 | Thinky Inkling (low)Thinking Machines Lab | 202,00 | 34,00 | 34,00 | $0.08 | 25.949 | |
| 65 | DeepSeek V4 Flash (high)DeepSeek | 202,00 | 34,00 | 34,00 | $0.15 | 535.441 | |
| 66 | GPT-5.6 Sol (none)OpenAI | 202,00 | 34,00 | 34,00 | $0.33 | 18.497 | |
| 67 | MiniMax M3MiniMax | 202,00 | 34,00 | 34,00 | $0.59 | 505.117 | |
| 68 | Qwen3.6 27BAlibaba Qwen | 202,00 | 34,00 | 34,00 | ≈$0.66 | 336.631 | |
| 69 | GLM 5.2 (high)Z.ai | 202,00 | 34,00 | 34,00 | ≈$1.21 | 330.631 | |
| 70 | Tencent Hy3 (none)Tencent | 198,25 | 32,75 | 32,75 | ≈$0.01 | 31.729 | |
| 71 | GPT-5.6 Luna (low)OpenAI | 198,25 | 32,75 | 32,75 | $0.02 | 35.050 | |
| 72 | Thinky Inkling (none)Thinking Machines Lab | 187,00 | 29,00 | 29,00 | $0.12 | 35.568 | |
| 73 | GPT-5.6 Luna (none)OpenAI | 179,50 | 26,50 | 26,50 | $0.01 | 20.011 | |
| 74 | GPT-5.6 Terra (none)OpenAI | 179,50 | 26,50 | 26,50 | $0.06 | 17.009 |
Tabloyu yana kaydırarak tüm sütunları görüntüleyin.
Cevap kâğıdı
dolgu = soruyu doğru çözen model oranı- 1MAT-1: 74 modelin 72 tanesi doğru çözdü
- 2MAT-2: 74 modelin 74 tanesi doğru çözdü
- 3MAT-3: 74 modelin 74 tanesi doğru çözdü
- 4MAT-4: 74 modelin 61 tanesi doğru çözdü
- 5MAT-5: 74 modelin 74 tanesi doğru çözdü
- 6MAT-6: 74 modelin 74 tanesi doğru çözdü
- 7MAT-7: 74 modelin 74 tanesi doğru çözdü
- 8MAT-8: 74 modelin 73 tanesi doğru çözdü
- 9MAT-9: 74 modelin 0 tanesi doğru çözdü
- 10MAT-10: 74 modelin 73 tanesi doğru çözdü
- 11MAT-11: 74 modelin 72 tanesi doğru çözdü
- 12MAT-12: 74 modelin 74 tanesi doğru çözdü
- 13MAT-13: 74 modelin 74 tanesi doğru çözdü
- 14MAT-14: 74 modelin 74 tanesi doğru çözdü
- 15MAT-15: 74 modelin 67 tanesi doğru çözdü
- 16MAT-16: 74 modelin 74 tanesi doğru çözdü
- 17MAT-17: 74 modelin 72 tanesi doğru çözdü
- 18MAT-18: 74 modelin 72 tanesi doğru çözdü
- 19MAT-19: 74 modelin 74 tanesi doğru çözdü
- 20MAT-20: ÖSYM tarafından iptal edildi, puanlamaya girmez
- 21MAT-21: 74 modelin 73 tanesi doğru çözdü
- 22MAT-22: 74 modelin 73 tanesi doğru çözdü
- 23MAT-23: 74 modelin 68 tanesi doğru çözdü
- 24MAT-24: 74 modelin 74 tanesi doğru çözdü
- 25MAT-25: 74 modelin 74 tanesi doğru çözdü
- 26MAT-26: 74 modelin 71 tanesi doğru çözdü
- 27MAT-27: 74 modelin 74 tanesi doğru çözdü
- 28MAT-28: 74 modelin 74 tanesi doğru çözdü
- 29MAT-29: 74 modelin 72 tanesi doğru çözdü
- 30MAT-30: 74 modelin 74 tanesi doğru çözdü
- 31MAT-31: 74 modelin 73 tanesi doğru çözdü
- 32MAT-32: 74 modelin 67 tanesi doğru çözdü
- 33MAT-33: 74 modelin 71 tanesi doğru çözdü
- 34MAT-34: 74 modelin 68 tanesi doğru çözdü
- 35MAT-35: 74 modelin 68 tanesi doğru çözdü
- 36MAT-36: 74 modelin 74 tanesi doğru çözdü
- 37MAT-37: 74 modelin 66 tanesi doğru çözdü
- 38MAT-38: 74 modelin 72 tanesi doğru çözdü
- 39MAT-39: 74 modelin 74 tanesi doğru çözdü
- 40MAT-40: 74 modelin 73 tanesi doğru çözdü
Koşudan çıkanlar
Üç bulgu
- Bulgu · Zirve
Aynı zirve, farklı maliyet
GPT-5.6 Luna (xhigh), GPT-5.6 Luna (max), Ring-2.6-1T (high) ve 40 yapılandırma daha, 213,25 puanla zirveyi paylaşıyor. Zirve grubundaki ölçülen maliyet $0.04 (GPT-5.6 Luna (xhigh)) ile $4.06 (Claude Sonnet 5 (max)) arasında. Ayrıca zirvedeki 1 modelin maliyeti bilinmiyor.
- Bulgu · Bölümler
Tam net tablosu
Matematik bölümünde tam nete ulaşan model: 0/74.
- Bulgu · Ölçüm sınırı
Bilinmeyen değer, sıfır değildir
Toplam 10 modelde en az bir ölçüm açıklaması var. Maliyet: 1 bilinmiyor, 9 yaklaşık.
Okuma notları
Kapsam ve ölçüm sınırları
- Puanlama: net = doğru − yanlış/4; geçersiz yanıtlar yanlış sayılır. · 100 + Matematik neti × 3
- Sıralama: Yuvarlanmamış puan yüksekten düşüğe sıralanır. Eşit puanda bilinen daha düşük maliyet önce gelir; maliyeti bilinmeyenler aynı puan grubunun sonuna gider. Tam eşitlikte kaynak sırası korunur.
- 1 modelin maliyeti bilinmediği için maliyet analizlerinden çıkarılır; 9 modelin maliyeti yaklaşık değer taşır.
- Model notları:
- Tencent Hy3 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
- Muse Glimmer 30B (high): Koşu ayarlarındaki 65.536 istenen tavandır; efektif tavan 32.768'dir. Diğer varyantlar 131.072 ile koştu, ancak modelin bağlamı 131.072 olduğundan genel tavan gönderilemezdi. Pinlenen Together endpoint'i ilan etmediği bir sınırla talebi 32.768'de kesiyor. 2026-08-12 ölçümünde bu tavanda hiçbir yanıt kesilmedi.
- Tencent Hy3 (low): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.
- DeepSeek V4 Pro (high): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
- Gemma 4 31B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,2 katıydı.
- DeepSeek V4 Pro (xhigh): Maliyet liste fiyatından hesaplandı; model allow_fallbacks ile koşuldu ve 2026-07-31 usage.cost ölçümünde gerçek fatura hesaplananın ≈3,9 katına ulaştı.
- GLM 5.2 (xhigh): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
- Qwen3.6 27B: Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,8 katıydı.
- GLM 5.2 (high): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,3 katıydı.
- Tencent Hy3 (none): Maliyet liste fiyatından hesaplandı; allow_fallbacks nedeniyle 2026-07-31 ölçümünde gerçek fatura hesaplananın ≈1,5 katıydı.