Puanlar nasıl hesaplanıyor?

Değerlendirmeler bağımsız olarak yürütülür. Her benchmark kendi puan aralığını kullanır; sıralama ham puanla yapılır ve eşitlikte daha düşük bilinen maliyet öne çıkar.

Değerlendirme akışı

  1. Görevi sabitle

    Soru seti, puanlama kuralı ve model koşulları değerlendirme başlamadan önce belirlenir.

  2. Ortak değerlendirme sözleşmesini uygula

    Her yayında soru/görev seti, puanlama ve temel limitler sabitlenir. Model veya sağlayıcıya özgü reasoning ve yönlendirme ayarları sonuçla birlikte açıklanır; ölçülmeyen eşitlik iddia edilmez.

  3. Sonucu doğrula

    Puan, sıra, maliyet ve token alanları kontrol edilir; ölçülmeyen değerler n/a olarak kalır.

Ortak kurallar

Ham puan

Puan yalnızca gösterimde yuvarlanır; sıralama yuvarlanmamış değerle yapılır.

Eşitlik

Aynı puanda daha düşük bilinen maliyet öne çıkar. Maliyeti bilinmeyen sonuç, bilinen sonuçların arkasında yer alır.

Bilinmeyen değer

Ölçülmeyen maliyet veya token değeri sıfır kabul edilmez; n/a olarak gösterilir.

Ayrı ölçekler

Sınav puanları ile ContextCurve 0–100 puanı birleştirilmez.

Bir benchmark örneği

2026 TYT yayınında net, doğru − (yanlış + geçersiz) / 4 olarak hesaplanır ve sınavın bölüm katsayıları uygulanır. Bu, ReWo-Bench'in evrensel formülü değil, yalnızca TYT yayınının puanlama sözleşmesidir.

2026 TYT sonuçlarını ve yöntem notlarını incele

Veri ve doğrulama

TUS · TTBT bilgi kesimi çalışması

72 soruluk TUS · TTBT derlemesinde bilgi kesimi karşılaştırması, yalnız bu çalışma için TTBT-15 (hatalı cevap anahtarı) ve TTBT-45'i (belirsiz tek en iyi cevap) hariç 70 soruyu puanlar. Önceki dilim 60, 2026-I dilimi 10 sorudur. Karşılaştırma, yalnız kontaminasyon açıklamasını zayıflatır; sıfır maruziyet veya nedensellik kanıtlamaz.

TUS · TTBT bilgi kesimi analizini aç