پرش به محتوا
هوش مصنوعی

مدل Grok 4.6 آمد؛ جهش بزرگ، ولی نه آن‌طور که تیترها می‌گویند

مدل جدید xAI روی چند بنچمارک از GPT-5.6 Sol جلو زده و در شاخص Artificial Analysis به عدد ۶۱ رسیده. اما ادعای «رتبه‌ی اول در CursorBench» که در بعضی خبرها آمده، با اعداد خود xAI جور درنمی‌آید.

تحریریه زاوینو۲ دقیقه مطالعه

Read this story in English

مدل Grok 4.6 آمد؛ جهش بزرگ، ولی نه آن‌طور که تیترها می‌گویند

شرکت xAI مدل Grok 4.6 را منتشر کرد و طبق بنچمارک‌های خودش، جهش قابل توجهی نسبت به نسخه‌ی قبلی داشته.

در شاخص Artificial Analysis Intelligence این مدل به عدد ۶۱ رسیده و با GPT-5.6 Sol شرکت OpenAI هم‌تراز شده. همچنین از Kimi K3 جلو زده و به رتبه‌ی سوم دنیا در این شاخص رسیده.

اما یک تصحیح لازم است

در چند روز گذشته این خبر با تیتر «Grok 4.6 رتبه‌ی اول CursorBench را گرفت و از Claude Fable 5 جلو زد» منتشر شد. این دقیق نیست.

نمره‌ی Grok 4.6 در CursorBench v3.2 عدد ۶۹.۹٪ است که نسبت به ۶۶.۷٪ نسخه‌ی قبل پیشرفت خوبی حساب می‌شود.

ولی در همان جدول مقایسه‌ی خود xAI، مدل Fable 5 Max با ۷۰.۵٪ بالاتر است. یعنی Grok دوم است، نه اول. اینکه جدول‌های رسمی معمولاً چطور چیده می‌شوند خودش یک بحث جداست.

این نوع خطا معمولاً وقتی پیش می‌آید که یک خبر از روی توییت اولیه بازنویسی می‌شود، نه از روی جدول اصلی.

مدل کجا واقعاً جلوست؟

طبق اعداد خود xAI، این مدل روی CursorBench، FrontierCode و AA-Briefcase از GPT-5.6 Sol جلوتر است.

اما روی DeepSWE هنوز عقب است؛ همان بنچمارکی که مسائل واقعی مهندسی نرم‌افزار را می‌سنجد.

جمع‌بندی منصفانه این است: Grok 4.6 در چند حوزه‌ی مشخص بهترین است، در چند حوزه‌ی دیگر نه، و مثل هر مدل دیگری بستگی دارد کارت چیست.

چرا این موضوع فراتر از xAI است؟

بنچمارک‌ها در هوش مصنوعی دارند به ابزار بازاریابی تبدیل می‌شوند. هر آزمایشگاه جدولی منتشر می‌کند که در آن مدل خودش برنده است، فقط با انتخاب اینکه کدام ستون‌ها را نشان بدهد.

راه‌حلش پیچیده نیست: قبل از باور کردن هر تیتری، جدول اصلی منبع را نگاه کن. معمولاً همان‌جا هست و معمولاً کامل‌تر از تیتر است. 👀

منابع

هم‌رسانی

خبرهای مرتبط

همه
علی‌بابا وزن‌های مدل ۲.۴ تریلیون پارامتری Qwen3.8-Max را آزاد کرد
هوش مصنوعی

علی‌بابا وزن‌های مدل ۲.۴ تریلیون پارامتری Qwen3.8-Max را آزاد کرد

برای اولین بار یک مدل رده‌ی Max از خانواده‌ی Qwen وزن‌هایش عمومی شد. مدل ۲.۴ تریلیون پارامتر دارد ولی در هر پرسش فقط ۹۵ میلیارد پارامتر فعال می‌شود. مشکل اینجاست که تقریباً هیچ‌کس سخت‌افزار اجرایش را ندارد.

خبرنامه

هر هفته مهم‌ترین اتفاق‌های هوش مصنوعی و تکنولوژی، خلاصه و بدون حاشیه، در ایمیلت.

هر وقت خواستی می‌توانی لغو عضویت کنی.