Davranış araştırması
LLM seçim davranışı
Dillere göre yanıt dağılımları
Seçim dağılımları
Bu seçenek yalnız anket yanıtlarını değiştirir; site dilini değiştirmez.
İlk yanıt payı: 7 güçlü, 6 orta, 7 zayıf; ortalama 55,8%.
Betimleyici yoğunluk bantları: güçlü ≥ %70; orta %45–<%70; zayıf <%45.
Diğer sütunlar için yana kaydırın.
| Soru | Kategori | Yanıt sayısı | En sık üç yanıt | İlk yanıt payı | İlk üç payı | Yoğunluk |
|---|---|---|---|---|---|---|
| 1 | sayı(1-100) | n=200 | 42 (114) · 47 (28) · 37 (19) | 57,0% | 80,5% | orta |
| 2 | renk | n=200 | MAVİ (186) · KIRMIZI (4) · YEŞİL (2) | 93,0% | 96,0% | güçlü |
| 3 | hayvan | n=200 | KEDİ (78) · ASLAN (39) · FİL (26) | 39,0% | 71,5% | zayıf |
| 4 | ülke | n=200 | JAPONYA (125) · TÜRKİYE (39) · FRANSA (7) | 62,5% | 85,5% | orta |
| 5 | şehir | n=200 | İSTANBUL (148) · PARİS (18) · izmir (8) | 74,0% | 87,0% | güçlü |
| 6 | meyve | n=200 | ELMA (180) · mango (7) · MUZ (5) | 90,0% | 96,0% | güçlü |
| 7 | sebze | n=200 | HAVUÇ (154) · PATATES (12) · PATLICAN (11) | 77,0% | 88,5% | güçlü |
| 8 | harf | n=200 | K (80) · M (46) · A (43) | 40,0% | 84,5% | zayıf |
| 9 | geometrik şekil | n=200 | ÜÇGEN (109) · DAİRE (42) · KARE (30) | 54,5% | 90,5% | orta |
| 10 | gezegen | n=200 | MARS (145) · SATÜRN (25) · JÜPİTER (13) | 72,5% | 91,5% | güçlü |
| 11 | element | n=200 | OKSİJEN (55) · ALTIN (51) · KARBON (28) | 27,5% | 67,0% | zayıf |
| 12 | meslek | n=200 | DOKTOR (46) · MÜHENDİS (41) · ÖĞRETMEN (37) | 23,0% | 62,0% | zayıf |
| 13 | spor | n=200 | FUTBOL (94) · BASKETBOL (57) · YÜZME (19) | 47,0% | 85,0% | orta |
| 14 | enstrüman | n=200 | PİYANO (97) · GİTAR (63) · KEMAN (30) | 48,5% | 95,0% | orta |
| 15 | kuş | n=200 | KARTAL (58) · SERÇE (53) · BAYKUŞ (11) | 29,0% | 61,0% | zayıf |
| 16 | otomobil markası | n=200 | TOYOTA (143) · BMW (16) · volvo (13) | 71,5% | 86,0% | güçlü |
| 17 | programlama dili | n=200 | PYTHON (190) · RUST (4) · JAVA (3) | 95,0% | 98,5% | güçlü |
| 18 | yemek | n=200 | MANTI (101) · PİZZA (26) · lahmacun (16) | 50,5% | 71,5% | orta |
| 19 | gün | n=200 | ÇARŞAMBA (85) · CUMA (29) · SALI (27) | 42,5% | 70,5% | zayıf |
| 20 | ay | n=200 | MART (45) · EKİM (34) · MAYIS (30) | 22,5% | 54,5% | zayıf |
Model özeti
Bu tablo seçim davranışını özetler; zekâ veya doğruluk sıralaması değildir.
Diğer sütunlar için yana kaydırın.
| Sıra | |||||
|---|---|---|---|---|---|
| 1 | anthropic/claude-opus-4.8 | 0,933 | 0,087 | 1,267 | 0,450 |
| 2 | anthropic/claude-sonnet-5 | 0,913 | 0,119 | 1,367 | 0,450 |
| 3 | qwen/qwen3.8-2.4t-a95b | 0,910 | 0,112 | 1,333 | 0,500 |
| 4 | tencent/hy-mt2-30b-a3b | 0,907 | 0,111 | 1,317 | 0,600 |
| 5 | google/gemma-4-31b-it | 0,897 | 0,121 | 1,333 | 0,600 |
| 6 | mistralai/ministral-3b-2512 | 0,883 | 0,151 | 1,467 | 0,150 |
| 7 | qwen/qwen3.8-max | 0,880 | 0,152 | 1,450 | 0,500 |
| 8 | google/gemini-3.7-flash | 0,870 | 0,177 | 1,567 | 0,500 |
| 9 | google/gemma-4-26b-a4b-it | 0,867 | 0,172 | 1,533 | 0,450 |
| 10 | openai/gpt-5.6-sol | 0,863 | 0,184 | 1,567 | 0,400 |
| 11 | inception/mercury-2 | 0,860 | 0,185 | 1,567 | 0,400 |
| 12 | openai/gpt-5.6-terra | 0,857 | 0,179 | 1,533 | 0,400 |
| 13 | thinkingmachines/inkling | 0,857 | 0,180 | 1,567 | 0,500 |
| 14 | anthropic/claude-fable-5.1 | 0,857 | 0,187 | 1,567 | 0,350 |
| 15 | meta/muse-spark-1.3 | 0,847 | 0,190 | 1,567 | 0,500 |
| 16 | google/gemini-3.1-pro-preview | 0,840 | 0,199 | 1,600 | 0,450 |
| 17 | deepseek/deepseek-v4-pro-0813 | 0,840 | 0,204 | 1,617 | 0,500 |
| 18 | nvidia/nemotron-3-ultra-550b-a55b | 0,837 | 0,214 | 1,667 | 0,400 |
| 19 | anthropic/claude-opus-5 | 0,823 | 0,228 | 1,683 | 0,450 |
| 20 | meta-llama/llama-3.3-70b-instruct | 0,817 | 0,237 | 1,733 | 0,300 |
| 21 | openai/gpt-5.6-luna | 0,817 | 0,243 | 1,767 | 0,450 |
| 22 | thinkingmachines/inkling-small | 0,813 | 0,240 | 1,750 | 0,550 |
| 23 | meta/muse-spark-1.2 | 0,803 | 0,242 | 1,750 | 0,350 |
| 24 | nvidia/nemotron-3.5-lightning | 0,793 | 0,272 | 1,883 | 0,500 |
| 25 | anthropic/claude-haiku-4.5 | 0,790 | 0,287 | 1,933 | 0,500 |
| 26 | x-ai/grok-4.6 | 0,783 | 0,273 | 1,867 | 0,450 |
| 27 | meta/muse-glimmer-30b | 0,783 | 0,282 | 1,883 | 0,500 |
| 28 | xiaomi/mimo-v2.5-pro | 0,777 | 0,290 | 1,933 | 0,450 |
| 29 | xiaomi/mimo-v2.5 | 0,770 | 0,294 | 1,917 | 0,350 |
| 30 | minimax/minimax-m3 | 0,770 | 0,296 | 1,950 | 0,450 |
| 31 | z-ai/glm-5.3-flash | 0,760 | 0,302 | 1,950 | 0,350 |
| 32 | qwen/qwen3.8-27b | 0,750 | 0,325 | 2,033 | 0,500 |
| 33 | qwen/qwen3.8-flash | 0,747 | 0,327 | 2,067 | 0,400 |
| 34 | deepseek/deepseek-v4-flash-0731 | 0,743 | 0,333 | 2,083 | 0,450 |
| 35 | moonshotai/kimi-k3 | 0,727 | 0,358 | 2,133 | 0,400 |
| 36 | mistralai/mistral-medium-3-5 | 0,707 | 0,369 | 2,167 | 0,650 |
| 37 | z-ai/glm-5.3 | 0,707 | 0,383 | 2,233 | 0,200 |
| 38 | meta-llama/llama-3.1-8b-instruct | 0,697 | 0,393 | 2,317 | 0,150 |
| 39 | nvidia/nemotron-3-nano-30b-a3b | 0,657 | 0,471 | 2,633 | 0,300 |
| 40 | meta-llama/llama-3.2-1b-instruct | 0,430 | 0,738 | 3,733 | 0,000 |
Yöntem ve sınırlar
40 modellik izin listesindeki her (model, anket dili, kategori, tekrar) anahtarı için kaynak sırasındaki ilk başarılı ve boş olmayan yanıt seçildi: 3 dil × 20 kategori × 5 tekrar = model başına 300, toplam 12.000 yanıt. D, 60 model-dil-kategori hücresinin ortalama modal payıdır; H, her hücrede entropi/ln(5) hesaplanıp 60 hücrede ortalanır; U, bu hücrelerdeki 1–5 benzersiz yanıt sayısının ortalamasıdır; L, 20 kategoride üç dilin modal yanıt uzlaşma payıdır. Eşit modal sayıda kaynakta ilk görülen yanıt korunur.
- ham kayıt
- 13.577
- Seçilen model kayıtları (hata ve tekrarlar dahil)
- 13.567
- kullanılabilir yanıt
- 12.000
- hata kayıtları
- 1.560
Varsayılan sıra: D azalan (300 yanıttaki eşit değerler birlikte); ardından H ve U artan, L azalan, model kimliği alfabetik. Yuvarlama yalnızca gösterimdedir.
- Bu betimleyici davranış sırası bir zeka, doğruluk veya gerçek rastgelelik ölçümü değildir.
- 15 model birden fazla sağlayıcı kaydı taşır; sağlayıcılar arası koşullar tam kontrollü değildir.
- Akıl yürütme 35 modelde medium olarak ayarlanmış, 5 modelde belirtilmemiştir.
- Sağlayıcı varsayılan örnekleme ayarları kaydedilmediği için sıkı ayar eşdeğerliği iddia edilmez.