Davranış araştırması

LLM seçim davranışı

Dillere göre yanıt dağılımları

Seçim dağılımları

Bu seçenek yalnız anket yanıtlarını değiştirir; site dilini değiştirmez.

İlk yanıt payı: 7 güçlü, 6 orta, 7 zayıf; ortalama 55,8%.

Betimleyici yoğunluk bantları: güçlü ≥ %70; orta %45–<%70; zayıf <%45.

SoruKategoriYanıt sayısıEn sık üç yanıtİlk yanıt payıİlk üç payıYoğunluk
1sayı(1-100)n=20042 (114) · 47 (28) · 37 (19)57,0%80,5%orta
2renkn=200MAVİ (186) · KIRMIZI (4) · YEŞİL (2)93,0%96,0%güçlü
3hayvann=200KEDİ (78) · ASLAN (39) · FİL (26)39,0%71,5%zayıf
4ülken=200JAPONYA (125) · TÜRKİYE (39) · FRANSA (7)62,5%85,5%orta
5şehirn=200İSTANBUL (148) · PARİS (18) · izmir (8)74,0%87,0%güçlü
6meyven=200ELMA (180) · mango (7) · MUZ (5)90,0%96,0%güçlü
7sebzen=200HAVUÇ (154) · PATATES (12) · PATLICAN (11)77,0%88,5%güçlü
8harfn=200K (80) · M (46) · A (43)40,0%84,5%zayıf
9geometrik şekiln=200ÜÇGEN (109) · DAİRE (42) · KARE (30)54,5%90,5%orta
10gezegenn=200MARS (145) · SATÜRN (25) · JÜPİTER (13)72,5%91,5%güçlü
11elementn=200OKSİJEN (55) · ALTIN (51) · KARBON (28)27,5%67,0%zayıf
12meslekn=200DOKTOR (46) · MÜHENDİS (41) · ÖĞRETMEN (37)23,0%62,0%zayıf
13sporn=200FUTBOL (94) · BASKETBOL (57) · YÜZME (19)47,0%85,0%orta
14enstrümann=200PİYANO (97) · GİTAR (63) · KEMAN (30)48,5%95,0%orta
15kuşn=200KARTAL (58) · SERÇE (53) · BAYKUŞ (11)29,0%61,0%zayıf
16otomobil markasın=200TOYOTA (143) · BMW (16) · volvo (13)71,5%86,0%güçlü
17programlama dilin=200PYTHON (190) · RUST (4) · JAVA (3)95,0%98,5%güçlü
18yemekn=200MANTI (101) · PİZZA (26) · lahmacun (16)50,5%71,5%orta
19günn=200ÇARŞAMBA (85) · CUMA (29) · SALI (27)42,5%70,5%zayıf
20ayn=200MART (45) · EKİM (34) · MAYIS (30)22,5%54,5%zayıf

Model özeti

Bu tablo seçim davranışını özetler; zekâ veya doğruluk sıralaması değildir.

Sütunlar
Sıra
1anthropic/claude-opus-4.80,9330,0871,2670,450
2anthropic/claude-sonnet-50,9130,1191,3670,450
3qwen/qwen3.8-2.4t-a95b0,9100,1121,3330,500
4tencent/hy-mt2-30b-a3b0,9070,1111,3170,600
5google/gemma-4-31b-it0,8970,1211,3330,600
6mistralai/ministral-3b-25120,8830,1511,4670,150
7qwen/qwen3.8-max0,8800,1521,4500,500
8google/gemini-3.7-flash0,8700,1771,5670,500
9google/gemma-4-26b-a4b-it0,8670,1721,5330,450
10openai/gpt-5.6-sol0,8630,1841,5670,400
11inception/mercury-20,8600,1851,5670,400
12openai/gpt-5.6-terra0,8570,1791,5330,400
13thinkingmachines/inkling0,8570,1801,5670,500
14anthropic/claude-fable-5.10,8570,1871,5670,350
15meta/muse-spark-1.30,8470,1901,5670,500
16google/gemini-3.1-pro-preview0,8400,1991,6000,450
17deepseek/deepseek-v4-pro-08130,8400,2041,6170,500
18nvidia/nemotron-3-ultra-550b-a55b0,8370,2141,6670,400
19anthropic/claude-opus-50,8230,2281,6830,450
20meta-llama/llama-3.3-70b-instruct0,8170,2371,7330,300
21openai/gpt-5.6-luna0,8170,2431,7670,450
22thinkingmachines/inkling-small0,8130,2401,7500,550
23meta/muse-spark-1.20,8030,2421,7500,350
24nvidia/nemotron-3.5-lightning0,7930,2721,8830,500
25anthropic/claude-haiku-4.50,7900,2871,9330,500
26x-ai/grok-4.60,7830,2731,8670,450
27meta/muse-glimmer-30b0,7830,2821,8830,500
28xiaomi/mimo-v2.5-pro0,7770,2901,9330,450
29xiaomi/mimo-v2.50,7700,2941,9170,350
30minimax/minimax-m30,7700,2961,9500,450
31z-ai/glm-5.3-flash0,7600,3021,9500,350
32qwen/qwen3.8-27b0,7500,3252,0330,500
33qwen/qwen3.8-flash0,7470,3272,0670,400
34deepseek/deepseek-v4-flash-07310,7430,3332,0830,450
35moonshotai/kimi-k30,7270,3582,1330,400
36mistralai/mistral-medium-3-50,7070,3692,1670,650
37z-ai/glm-5.30,7070,3832,2330,200
38meta-llama/llama-3.1-8b-instruct0,6970,3932,3170,150
39nvidia/nemotron-3-nano-30b-a3b0,6570,4712,6330,300
40meta-llama/llama-3.2-1b-instruct0,4300,7383,7330,000

Yöntem ve sınırlar

40 modellik izin listesindeki her (model, anket dili, kategori, tekrar) anahtarı için kaynak sırasındaki ilk başarılı ve boş olmayan yanıt seçildi: 3 dil × 20 kategori × 5 tekrar = model başına 300, toplam 12.000 yanıt. D, 60 model-dil-kategori hücresinin ortalama modal payıdır; H, her hücrede entropi/ln(5) hesaplanıp 60 hücrede ortalanır; U, bu hücrelerdeki 1–5 benzersiz yanıt sayısının ortalamasıdır; L, 20 kategoride üç dilin modal yanıt uzlaşma payıdır. Eşit modal sayıda kaynakta ilk görülen yanıt korunur.

ham kayıt
13.577
Seçilen model kayıtları (hata ve tekrarlar dahil)
13.567
kullanılabilir yanıt
12.000
hata kayıtları
1.560

Varsayılan sıra: D azalan (300 yanıttaki eşit değerler birlikte); ardından H ve U artan, L azalan, model kimliği alfabetik. Yuvarlama yalnızca gösterimdedir.

  • Bu betimleyici davranış sırası bir zeka, doğruluk veya gerçek rastgelelik ölçümü değildir.
  • 15 model birden fazla sağlayıcı kaydı taşır; sağlayıcılar arası koşullar tam kontrollü değildir.
  • Akıl yürütme 35 modelde medium olarak ayarlanmış, 5 modelde belirtilmemiştir.
  • Sağlayıcı varsayılan örnekleme ayarları kaydedilmediği için sıkı ayar eşdeğerliği iddia edilmez.

İndirmeler

JSON belgesiCSV tablosuSıralı model özeti posteri (PNG)