نمرهی DeepSeek V4 Pro بین ۹۱ تا ۹۹؛ بسته به اینکه چه کسی تست را اجرا کند
همان مدل، همان صورت سؤال، و نمرهای که بین ۹۱ تا ۹۹ جابهجا میشه. چیزی که تیترها جهش هشتپلهای خواندند، در واقع دامنهی نوسان خود بنچمارک است.

کاربری با نام xiaobright روز ۱۵ آگوست دو ریپازیتوری منتشر کرد که نشون میده نمرهی مدل DeepSeek V4 Pro روی یک تسک مهندسی منجمد، بسته به هارنسی که اجرایش میکنه، بین ۹۱ تا ۹۹ بالا و پایین میره. تستی تعمیر نشده و نمرهای هشت پله نپریده؛ همین دامنهی هشتنمرهای خودش خبر است.
چیزی که واقعاً اندازه گرفته شد
تسک Project2 V4.1b عمداً منجمد نگه داشته شده تا فقط یک متغیر تکان بخوره: محیطی که مدل داخلش کار میکنه. روی همین یک تسک، اجراهای منتشرشده مدل را در حالت standard روی ۹۱، در PTC روی ۹۲، در حالت minimal روی ۹۶ و ۹۹، و زیر پریست جامعهمحور Anchored Standard روی ۹۸ و ۹۹ میگذارند. صورت سؤال یکی است، وزنهای مدل یکی است، و فاصلهی کف تا سقف هشت نمره.
نویسنده دلیلش را هم نام برده: سیستمپرامپت اولین درخواست، اسم ابزارها و اسکیمای ابزارها مدل را وارد مسیرهای اجرایی متفاوتی میکنن. حساب teortaxestex که این کار را بازنشر کرد، روش را همینطور جمع بست: یک مدل، یک صورت سؤال ثابت، و حذف متغیرها یکییکی بین OpenCode، Standard، PTC و حالت مینیمال.
جدول همان گزارش، نمرههای مرجع بقیه را هم دارد: GPT-5.6 Sol با ۹۹ و ۹۸، Claude Fable 5 با ۹۸ و Claude Opus 5 با ۹۷. شرکت DeepSeek خودش V4 Pro را سیزدهم آگوست رسمی کرده بود، با ارتقاهای ایجنتی و تلاش استدلالی قابل تنظیم. جمعه هم اجراهای DeepSWE چرخید که نسخهی 0813 را روی ۸۸.۵٪ pass@4 و بالاتر از Sol و Fable 5 میگذاشت، و Together هزینهاش را $0.24 برای هر تسک اعلام کرد: ۳۵ برابر کمتر از Sol و ۹۰ برابر کمتر از Fable.
فاصلهی این جدول تا ریپوی خود شما
دامنهی نوسان یک مدل روی یک تسک هشت نمره است و فاصلهی صدرنشین جدول تا مدل چهارم، دو نمره. وقتی نویز چند برابر سیگنال است، جملهی «فلان مدل از فلان مدل جلو زد» از دل این عدد بیرون نمیآید. برای Sol دو عدد گزارش شده و برای Fable 5 و Opus 5 فقط یکی، پس هیچکس نمیدونه آنها زیر همین پریستها چقدر جابهجا میشدند؛ مقایسهی بهترین پیکربندی یکی با تکعدد بقیه، اصلاً مقایسه نیست.
مهمتر برای کسی که مدل را روی ریپوی خودش میبره: همان سه چیزی که اینجا هشت نمره را جابهجا کرد، همان چیزهاییه که تو محصول خودتان دست خودتان است، یعنی سیستمپرامپت، اسم ابزارها و اسکیمایشان. بنچمارک میگوید مدل داخل هارنس یک نفر دیگر چه کرد، نه اینکه داخل هارنس شما چه میکند. هارنس کدنویسی خود دیپسیک که هر تکهاش قابل تعویض است، همین نکته را از سمت سازنده تأیید میکنه، و راهنمای خواندن بنچمارکهای هوش مصنوعی نقطهی شروع بهتری از تیتر است. 🔍
طرف دیگر ماجرا
حساب teortaxestex که خودش داده را پخش کرد، تندترین نقد را هم نوشت: مدل به bash و ادیتور رشتهای overfit شده. اگر این درست باشه، عدد ۹۹ به جای توان عمومی کدنویسی، اندازهی همشکل شدن مدل با یک شکل خاص از ابزار را نشون میده.
بعد نوبت بازتولیدپذیریست. ادعا شده همهی داده باز است و هر کسی میتونه راستیآزمایی کنه، ولی diff دقیق هارنس، یعنی متن سیستمپرامپتها و اسکیمای ابزارها در هر حالت، در چیزی که به ما رسیده منتشر نشده. تا آن فایلها بیرون نیاد، نه ۹۱ و نه ۹۹ هیچکدام مستقل قابل بازتولید نیستند و هر دو در حد ادعا میمانند.
عدد ۸۸.۵٪ هم لنگ دارد، چون pass@4 یعنی چهار بار تلاش و شمردن بهترین نتیجه. یک کامنت زیر همان جدول گفته بزرگترین جهش بین pass@1 و pass@2 بوده، پس عدد تکتلاشی که به کار روزمره نزدیکتر است پایینتر و منتشرنشده باقی مانده. جدول باز دیگری هم که کنار همین اجراها میچرخید، Luna را در pass@4 بالاتر از همه گذاشته بود، و رقم $0.24 از یک ارائهدهنده و یک دور اجرا میآید.
انصاف حکم میکند یک چیز هم به نفع DeepSeek نوشته بشه: خود شرکت جایی نگفته نمرهاش ۹۹ است. آن روایت از جمعبندی خبرها بیرون آمده، نه از اعلام سازنده. همان الگویی که پشت تیتر جهش Grok 4.6 هم بود، دوباره تکرار شده و در بخش هوش مصنوعی کم ندیدهایمش.
سوالهای پرتکرار
نمرهی DeepSeek V4 Pro در تست کدنویسی چند است؟
یک عدد ندارد. روی تسک منجمد Project2 V4.1b، اجراهای منتشرشده بین ۹۱ تا ۹۹ پخش شدهاند و تفاوت فقط از حالت اجرا میآید: ۹۱ در standard، ۹۲ در PTC، ۹۶ و ۹۹ در minimal و ۹۸ و ۹۹ زیر پریست Anchored Standard. هر کسی یکی از این اعداد را به تنهایی نقل کند، دامنه را حذف کرده است.
چرا تغییر هارنس نمرهی مدل را عوض میکند؟
چون هارنس تعیین میکند مدل چه چیزی میبیند و با چه ابزاری کار میکند. گزارش xiaobright میگوید سیستمپرامپت اولین درخواست، اسم ابزارها و اسکیمای آنها مدل را وارد مسیرهای اجرایی متفاوتی میکنند و مسیر متفاوت یعنی خروجی متفاوت روی همان صورت سؤال. به همین دلیل عوض شدن هارنس نمرهی همهی مدلهای جدول را تکان میدهد، نه فقط یکی را.
۸۸.۵٪ pass@4 یعنی چه؟
یعنی مدل تا چهار بار برای هر مسئله تلاش کرده و اگر یکی از تلاشها جواب داده، مسئله موفق حساب شده. عدد تکتلاشی یعنی pass@1 همیشه از این پایینتر است و در این اجراها منتشر نشده. یک کامنت زیر همان جدول گفته بیشترین جهش بین pass@1 و pass@2 بوده، که یعنی فاصلهی این دو عدد کم نیست.




