مدل Grok 4.6 آمد؛ جهش بزرگ، ولی نه آنطور که تیترها میگویند
مدل جدید xAI روی چند بنچمارک از GPT-5.6 Sol جلو زده و در شاخص Artificial Analysis به عدد ۶۱ رسیده. اما ادعای «رتبهی اول در CursorBench» که در بعضی خبرها آمده، با اعداد خود xAI جور درنمیآید.

شرکت xAI مدل Grok 4.6 را منتشر کرد و طبق بنچمارکهای خودش، جهش قابل توجهی نسبت به نسخهی قبلی داشته.
در شاخص Artificial Analysis Intelligence این مدل به عدد ۶۱ رسیده و با GPT-5.6 Sol شرکت OpenAI همتراز شده. همچنین از Kimi K3 جلو زده و به رتبهی سوم دنیا در این شاخص رسیده.
اما یک تصحیح لازم است
در چند روز گذشته این خبر با تیتر «Grok 4.6 رتبهی اول CursorBench را گرفت و از Claude Fable 5 جلو زد» منتشر شد. این دقیق نیست.
نمرهی Grok 4.6 در CursorBench v3.2 عدد ۶۹.۹٪ است که نسبت به ۶۶.۷٪ نسخهی قبل پیشرفت خوبی حساب میشود.
ولی در همان جدول مقایسهی خود xAI، مدل Fable 5 Max با ۷۰.۵٪ بالاتر است. یعنی Grok دوم است، نه اول. اینکه جدولهای رسمی معمولاً چطور چیده میشوند خودش یک بحث جداست.
این نوع خطا معمولاً وقتی پیش میآید که یک خبر از روی توییت اولیه بازنویسی میشود، نه از روی جدول اصلی.
مدل کجا واقعاً جلوست؟
طبق اعداد خود xAI، این مدل روی CursorBench، FrontierCode و AA-Briefcase از GPT-5.6 Sol جلوتر است.
اما روی DeepSWE هنوز عقب است؛ همان بنچمارکی که مسائل واقعی مهندسی نرمافزار را میسنجد.
جمعبندی منصفانه این است: Grok 4.6 در چند حوزهی مشخص بهترین است، در چند حوزهی دیگر نه، و مثل هر مدل دیگری بستگی دارد کارت چیست.
چرا این موضوع فراتر از xAI است؟
بنچمارکها در هوش مصنوعی دارند به ابزار بازاریابی تبدیل میشوند. هر آزمایشگاه جدولی منتشر میکند که در آن مدل خودش برنده است، فقط با انتخاب اینکه کدام ستونها را نشان بدهد.
راهحلش پیچیده نیست: قبل از باور کردن هر تیتری، جدول اصلی منبع را نگاه کن. معمولاً همانجا هست و معمولاً کاملتر از تیتر است. 👀




