پرش به محتوا
آموزشی

بنچمارک مدل‌های هوش مصنوعی را چطور بخوانیم؟ راهنمای کامل

هر هفته یک شرکت اعلام می‌کند مدلش رکورد زده. اما بنچمارک دقیقاً چه چیزی را می‌سنجد، چرا همیشه شرکت اعلام‌کننده برنده است، و کدام عددها واقعاً به کار تو می‌آیند؟

تحریریه زاوینو۴ دقیقه مطالعه

Read this story in English

بنچمارک و مقایسه مدل‌های هوش مصنوعی

هر چند هفته یک بار خبری می‌آید که «فلان مدل رکورد زد». عددی هم کنارش هست: ۶۵.۳٪، ۸۴.۵٪، ۶۱.

اگر تا حالا برایت سوال شده که این عددها دقیقاً یعنی چه و چرا همیشه شرکت اعلام‌کننده برنده است، این راهنما برای همان است.

بنچمارک اصلاً چیست؟

بنچمارک یک مجموعه‌ی ثابت از مسئله‌هاست که همه‌ی مدل‌ها با آن سنجیده می‌شوند.

منطقش ساده است. اگر بخواهیم دو مدل را مقایسه کنیم، باید هر دو یک آزمون یکسان بدهند. وگرنه ادعای «مدل ما بهتر است» هیچ معنایی ندارد.

نکته‌ای که زیاد فراموش می‌شود این است که نمره فقط توانایی مدل را در همان نوع مسئله نشان می‌دهد. یک مدل که در ریاضی عالی است، ممکن است در نوشتن متن فارسی ضعیف باشد. بنچمارک، سنجش هوش کلی نیست.

بنچمارک‌هایی که زیاد می‌بینی

چند اسم مدام تکرار می‌شوند. بد نیست بدانی هرکدام چه می‌سنجد.

بنچمارک‌های DeepSWE و SWE-bench نزدیک‌ترین تست‌ها به کار واقعی برنامه‌نویسی هستند. مدل یک مخزن کد واقعی و یک ایراد ثبت‌شده می‌گیرد و باید رفعش کند. همین تست بود که نمره‌ی Gemini 3.7 Flash را از ۴۹٪ به ۶۵.۳٪ رساند. تست‌های خود پروژه تصمیم می‌گیرند موفق شده یا نه.

تست MMLU دانش عمومی را در ده‌ها رشته می‌سنجد، از تاریخ تا پزشکی. سال‌هاست مرجع است، ولی چون قدیمی شده، بیشتر مدل‌های جدید نمره‌های نزدیک به هم می‌گیرند و دیگر خوب تفکیک نمی‌کند.

بنچمارک CyberGym می‌سنجد مدل تا چه حد می‌تواند از روی سورس‌کد آسیب‌پذیری امنیتی پیدا و تأیید کند. بالاترین نمره‌ی فعلی‌اش متعلق به GLM-5.3 با ۸۴.۵٪ است.

شاخص Artificial Analysis خودش بنچمارک نیست؛ ترکیبی از چند بنچمارک است که یک عدد واحد می‌دهد. برای مقایسه‌ی سریع خوب است، برای تصمیم دقیق نه.

پنج تله‌ای که باید بشناسی

۱. جدول را خود شرکت انتخاب می‌کند

این مهم‌ترین نکته‌ی کل این متن است.

وقتی آزمایشگاهی مدل جدید می‌دهد، جدولی منتشر می‌کند که در آن برنده است. این لزوماً دروغ نیست؛ فقط انتخابی است. مدل ممکن است در سه بنچمارک اول باشد و در چهار تای دیگر عقب. جدول رسمی همان سه تا را دارد.

نمونه‌اش همین چند روز پیش اتفاق افتاد. خبری منتشر شد که Grok 4.6 در CursorBench رتبه‌ی اول را گرفته. جدول خودِ xAI نشان می‌داد Fable 5 Max با ۷۰.۵٪ بالاتر از ۶۹.۹٪ گروک است. مدل دوم بود، نه اول.

عادت درست: قبل از باور کردن تیتر، جدول کامل منبع اصلی را باز کن.

۲. آلودگی داده

اگر سوال‌های آزمون در داده‌ی آموزشی مدل بوده باشند، مدل جواب را حفظ کرده، نه حل کرده.

این اتفاق رایج است، چون بنچمارک‌ها عمومی‌اند و داده‌ی آموزشی از اینترنت جمع می‌شود. به همین دلیل بنچمارک‌های تازه‌تر معمولاً معتبرترند، و نمره‌ی یک بنچمارک قدیمی هر سال بی‌ارزش‌تر می‌شود.

۳. عدد بدون نسخه، بی‌معناست

بنچمارک‌ها هم نسخه دارند. DeepSWE v1.1 با نسخه‌ی قبلی‌اش یکی نیست. مقایسه‌ی نمره‌ی دو مدل روی دو نسخه‌ی متفاوت، مقایسه نیست.

۴. شرایط اجرا را کسی نمی‌گوید

یک مدل با چند بار تلاش، با ابزار، و با بودجه‌ی توکن بالا نمره‌ی خیلی بهتری می‌گیرد تا وقتی یک‌بار و بدون ابزار اجرا شود. این جزئیات معمولاً در پانویس است، نه در تیتر.

۵. اختلاف کم، اختلاف نیست

فرق ۸۴.۵٪ با ۸۳.۸٪ در عمل احتمالاً هیچ است. این فاصله در محدوده‌ی نویز آماری است و با تکرار آزمون ممکن است جابه‌جا شود. فقط وقتی اختلاف چند واحد کامل باشد، به تفاوت واقعی در کار روزمره ترجمه می‌شود.

عددی که واقعاً باید نگاه کنی

اگر می‌خواهی یک مدل برای کار انتخاب کنی، نمره‌ی خام کمتر از این دو چیز اهمیت دارد.

اول، قیمت به‌ازای هر امتیاز. مدلی که ۹۵٪ کیفیت مدل برتر را با یک‌پنجم قیمت می‌دهد، برای بیشتر کارها انتخاب بهتری است. رقابت امسال دقیقاً روی همین جبهه است، نه روی «کدام باهوش‌تر است».

دوم، تست خودت. ده تا نمونه از کار واقعی خودت بردار و روی دو یا سه مدل اجرا کن. این آزمون کوچک، از هر جدولی برایت دقیق‌تر است، چون دقیقاً همان چیزی را می‌سنجد که برایت مهم است.

بنچمارک‌ها برای مقایسه‌ی کلی خوبند. برای تصمیم شخصی، جای تجربه‌ی خودت را نمی‌گیرند. 💡

سوال‌های پرتکرار

بنچمارک هوش مصنوعی یعنی چه؟

بنچمارک یک مجموعه‌ی ثابت از مسئله‌هاست که همه‌ی مدل‌ها با آن سنجیده می‌شوند تا نتیجه‌شان قابل مقایسه باشد. مثل یک آزمون استاندارد؛ نمره فقط توانایی مدل در همان نوع مسئله را نشان می‌دهد، نه هوش کلی‌اش را.

چرا هر شرکتی در جدول خودش برنده است؟

چون خودش انتخاب می‌کند کدام ستون‌ها را نشان بدهد. یک مدل ممکن است در سه بنچمارک اول باشد و در چهار تای دیگر عقب؛ جدول رسمی معمولاً همان سه تا را دارد. راه‌حل این است که به جدول کامل منبع نگاه کنی، نه به تیتر.

کدام بنچمارک برای کدنویسی مهم است؟

بنچمارک DeepSWE و SWE-bench نزدیک‌ترین‌ها به کار واقعی‌اند، چون مدل باید یک ایراد واقعی را در یک مخزن واقعی رفع کند. بنچمارک‌هایی که فقط تابع کوتاه می‌نویسند، فاصله‌ی زیادی با کار روزمره دارند.

آلودگی داده در بنچمارک یعنی چه؟

یعنی سوال‌های آزمون در داده‌ی آموزشی مدل بوده‌اند. در این حالت مدل جواب را حفظ کرده، نه اینکه حل کرده باشد. به همین دلیل بنچمارک‌های تازه‌ساز معمولاً معتبرترند و نمره‌ها با گذشت زمان بی‌ارزش می‌شوند.

منابع

هم‌رسانی

خبرهای مرتبط

همه
علی‌بابا وزن‌های مدل ۲.۴ تریلیون پارامتری Qwen3.8-Max را آزاد کرد
هوش مصنوعی

علی‌بابا وزن‌های مدل ۲.۴ تریلیون پارامتری Qwen3.8-Max را آزاد کرد

برای اولین بار یک مدل رده‌ی Max از خانواده‌ی Qwen وزن‌هایش عمومی شد. مدل ۲.۴ تریلیون پارامتر دارد ولی در هر پرسش فقط ۹۵ میلیارد پارامتر فعال می‌شود. مشکل اینجاست که تقریباً هیچ‌کس سخت‌افزار اجرایش را ندارد.

خبرنامه

هر هفته مهم‌ترین اتفاق‌های هوش مصنوعی و تکنولوژی، خلاصه و بدون حاشیه، در ایمیلت.

هر وقت خواستی می‌توانی لغو عضویت کنی.