پرش به محتوا
هوش مصنوعی

نمره‌ی DeepSeek V4 Pro بین ۹۱ تا ۹۹؛ بسته به اینکه چه کسی تست را اجرا کند

همان مدل، همان صورت سؤال، و نمره‌ای که بین ۹۱ تا ۹۹ جابه‌جا می‌شه. چیزی که تیترها جهش هشت‌پله‌ای خواندند، در واقع دامنه‌ی نوسان خود بنچمارک است.

تحریریه زاوینو۴ دقیقه مطالعه

Read this story in English

نمودار نمره‌ی بنچمارک DeepSeek V4 Pro که در حالت‌های مختلف هارنس بین ۹۱ تا ۹۹ جابه‌جا می‌شه

کاربری با نام xiaobright روز ۱۵ آگوست دو ریپازیتوری منتشر کرد که نشون می‌ده نمره‌ی مدل DeepSeek V4 Pro روی یک تسک مهندسی منجمد، بسته به هارنسی که اجرایش می‌کنه، بین ۹۱ تا ۹۹ بالا و پایین می‌ره. تستی تعمیر نشده و نمره‌ای هشت پله نپریده؛ همین دامنه‌ی هشت‌نمره‌ای خودش خبر است.

چیزی که واقعاً اندازه گرفته شد

تسک Project2 V4.1b عمداً منجمد نگه داشته شده تا فقط یک متغیر تکان بخوره: محیطی که مدل داخلش کار می‌کنه. روی همین یک تسک، اجراهای منتشرشده مدل را در حالت standard روی ۹۱، در PTC روی ۹۲، در حالت minimal روی ۹۶ و ۹۹، و زیر پریست جامعه‌محور Anchored Standard روی ۹۸ و ۹۹ می‌گذارند. صورت سؤال یکی است، وزن‌های مدل یکی است، و فاصله‌ی کف تا سقف هشت نمره.

نویسنده دلیلش را هم نام برده: سیستم‌پرامپت اولین درخواست، اسم ابزارها و اسکیمای ابزارها مدل را وارد مسیرهای اجرایی متفاوتی می‌کنن. حساب teortaxestex که این کار را بازنشر کرد، روش را همین‌طور جمع بست: یک مدل، یک صورت سؤال ثابت، و حذف متغیرها یکی‌یکی بین OpenCode، Standard، PTC و حالت مینیمال.

جدول همان گزارش، نمره‌های مرجع بقیه را هم دارد: GPT-5.6 Sol با ۹۹ و ۹۸، Claude Fable 5 با ۹۸ و Claude Opus 5 با ۹۷. شرکت DeepSeek خودش V4 Pro را سیزدهم آگوست رسمی کرده بود، با ارتقاهای ایجنتی و تلاش استدلالی قابل تنظیم. جمعه هم اجراهای DeepSWE چرخید که نسخه‌ی 0813 را روی ۸۸.۵٪ pass@4 و بالاتر از Sol و Fable 5 می‌گذاشت، و Together هزینه‌اش را $0.24 برای هر تسک اعلام کرد: ۳۵ برابر کمتر از Sol و ۹۰ برابر کمتر از Fable.

فاصله‌ی این جدول تا ریپوی خود شما

دامنه‌ی نوسان یک مدل روی یک تسک هشت نمره است و فاصله‌ی صدرنشین جدول تا مدل چهارم، دو نمره. وقتی نویز چند برابر سیگنال است، جمله‌ی «فلان مدل از فلان مدل جلو زد» از دل این عدد بیرون نمی‌آید. برای Sol دو عدد گزارش شده و برای Fable 5 و Opus 5 فقط یکی، پس هیچ‌کس نمی‌دونه آن‌ها زیر همین پریست‌ها چقدر جابه‌جا می‌شدند؛ مقایسه‌ی بهترین پیکربندی یکی با تک‌عدد بقیه، اصلاً مقایسه نیست.

مهم‌تر برای کسی که مدل را روی ریپوی خودش می‌بره: همان سه چیزی که اینجا هشت نمره را جابه‌جا کرد، همان چیزهاییه که تو محصول خودتان دست خودتان است، یعنی سیستم‌پرامپت، اسم ابزارها و اسکیمای‌شان. بنچمارک می‌گوید مدل داخل هارنس یک نفر دیگر چه کرد، نه اینکه داخل هارنس شما چه می‌کند. هارنس کدنویسی خود دیپ‌سیک که هر تکه‌اش قابل تعویض است، همین نکته را از سمت سازنده تأیید می‌کنه، و راهنمای خواندن بنچمارک‌های هوش مصنوعی نقطه‌ی شروع بهتری از تیتر است. 🔍

طرف دیگر ماجرا

حساب teortaxestex که خودش داده را پخش کرد، تندترین نقد را هم نوشت: مدل به bash و ادیتور رشته‌ای overfit شده. اگر این درست باشه، عدد ۹۹ به جای توان عمومی کدنویسی، اندازه‌ی هم‌شکل شدن مدل با یک شکل خاص از ابزار را نشون می‌ده.

بعد نوبت بازتولیدپذیری‌ست. ادعا شده همه‌ی داده باز است و هر کسی می‌تونه راستی‌آزمایی کنه، ولی diff دقیق هارنس، یعنی متن سیستم‌پرامپت‌ها و اسکیمای ابزارها در هر حالت، در چیزی که به ما رسیده منتشر نشده. تا آن فایل‌ها بیرون نیاد، نه ۹۱ و نه ۹۹ هیچ‌کدام مستقل قابل بازتولید نیستند و هر دو در حد ادعا می‌مانند.

عدد ۸۸.۵٪ هم لنگ دارد، چون pass@4 یعنی چهار بار تلاش و شمردن بهترین نتیجه. یک کامنت زیر همان جدول گفته بزرگ‌ترین جهش بین pass@1 و pass@2 بوده، پس عدد تک‌تلاشی که به کار روزمره نزدیک‌تر است پایین‌تر و منتشرنشده باقی مانده. جدول باز دیگری هم که کنار همین اجراها می‌چرخید، Luna را در pass@4 بالاتر از همه گذاشته بود، و رقم $0.24 از یک ارائه‌دهنده و یک دور اجرا می‌آید.

انصاف حکم می‌کند یک چیز هم به نفع DeepSeek نوشته بشه: خود شرکت جایی نگفته نمره‌اش ۹۹ است. آن روایت از جمع‌بندی خبرها بیرون آمده، نه از اعلام سازنده. همان الگویی که پشت تیتر جهش Grok 4.6 هم بود، دوباره تکرار شده و در بخش هوش مصنوعی کم ندیده‌ایمش.

سوال‌های پرتکرار

نمره‌ی DeepSeek V4 Pro در تست کدنویسی چند است؟

یک عدد ندارد. روی تسک منجمد Project2 V4.1b، اجراهای منتشرشده بین ۹۱ تا ۹۹ پخش شده‌اند و تفاوت فقط از حالت اجرا می‌آید: ۹۱ در standard، ۹۲ در PTC، ۹۶ و ۹۹ در minimal و ۹۸ و ۹۹ زیر پریست Anchored Standard. هر کسی یکی از این اعداد را به تنهایی نقل کند، دامنه را حذف کرده است.

چرا تغییر هارنس نمره‌ی مدل را عوض می‌کند؟

چون هارنس تعیین می‌کند مدل چه چیزی می‌بیند و با چه ابزاری کار می‌کند. گزارش xiaobright می‌گوید سیستم‌پرامپت اولین درخواست، اسم ابزارها و اسکیمای آن‌ها مدل را وارد مسیرهای اجرایی متفاوتی می‌کنند و مسیر متفاوت یعنی خروجی متفاوت روی همان صورت سؤال. به همین دلیل عوض شدن هارنس نمره‌ی همه‌ی مدل‌های جدول را تکان می‌دهد، نه فقط یکی را.

۸۸.۵٪ pass@4 یعنی چه؟

یعنی مدل تا چهار بار برای هر مسئله تلاش کرده و اگر یکی از تلاش‌ها جواب داده، مسئله موفق حساب شده. عدد تک‌تلاشی یعنی pass@1 همیشه از این پایین‌تر است و در این اجراها منتشر نشده. یک کامنت زیر همان جدول گفته بیشترین جهش بین pass@1 و pass@2 بوده، که یعنی فاصله‌ی این دو عدد کم نیست.

منابع

هم‌رسانی

خبرهای مرتبط

همه

خبرنامه

هر هفته مهم‌ترین اتفاق‌های هوش مصنوعی و تکنولوژی، خلاصه و بدون حاشیه، در ایمیلت.

هر وقت خواستی می‌توانی لغو عضویت کنی.