Uzun bağlam

ReWo ContextCurve Türkçe v1

Aynı beş soru altı bağlam uzunluğunda tekrarlanır; soru, cevap ve kanıt sabit kalır, yalnız bağlam uzar.

Liderlik tablosu

düşük doğrulukyüksek doğrulukkısmi ölçümgönderilemedi

PUAN bağlam kovalarından önce görünür; kovalar için tabloyu yana kaydırın.

#ModelPUAN16K32K64K128K256K512K
1GPT-5.6 Sol97,1100%100%100%100%100%80%
2Gemini 3.1 Pro83,080%80%80%80%80%80%
3DeepSeek V4 Flash 073182,880%100%100%80%60%80%
4Grok 4.582,7100%100%100%100%100%sınır
5GPT-5.6 Terra77,380%60%100%80%60%60%
6GPT-5.6 Luna77,080%60%100%60%80%60%
7Kimi K375,9100%100%80%80%80%ret
8DeepSeek V4 Pro74,180%80%80%80%80%40%
9GLM 5.271,6100%60%80%60%60%100%
10Qwen3.6 27B67,3100%80%80%100%100%sınır
11Qwen3.8 Max66,060%80%60%40%80%60%
12Claude Opus 550,740%40%40%40%0%40%
13Gemini 3.6 Flash48,820%40%40%40%40%0%
14Claude Sonnet 535,660%40%0%20%40%40%
15Gemma 4 31B17,620%0%0%0%0%sınır

MiniMax M3 sıralama dışı — format ihlali 22/30 hücre. Ham puanı 22,3.

Görev türü

aggregation
63% n=90
multi_hop
73% n=184
single_hop
76% n=90
temporal_coreference
31% n=90

Kapasite bulguları

  • 15 hücre Modelin kanonik bağlam penceresi bu kovaya yetmiyor.
  • 3 hücre İstek, modelin kendi tokenizasyonunda pencereyi aşıyor.
  • 8 hücre Sağlayıcı, ilan edilen pencereye rağmen isteği reddetti.

Sayımlar hücre düzeyindedir; bir kova ancak beş hücresinin tamamı gönderilemediğinde tabloda — görünür.

Yöntem ve sınırlar

  • Kova başına 5 soru: tek yanlış cevap doğruluğu %20 oynatır.
  • Judge deepseek/deepseek-v4-pro; tutarlılık %88.1; henüz insan kalibrasyonu yok, sıralamaya girmez.
  • Sözleşme dışı cevaplar tanısal bir gözlemdir ve sıralamayı belirlemez. Format ihlali ise puana girer: ayrıştırılamayan cevap doğru cevap sayılmaz, oranı yarıyı aşan model sıralama dışı kalır.
  • suite qa-v1/execution-v3 · merkle ca0d86b4a1c0… · $178.7