|
İnsanların kolayca çözdüğü ama modellerin zorlandığı sağduyu ve tuzak sorulardan oluşan benchmark. İnsan ortalaması yüzde doksan civarı, en iyi modeller altında kalıyor. Modellerin nerede hâlâ zayıf olduğunu gösteren nadir testlerden. |
|
noway · 19 saat önce
|
0 |
noway