پرش به محتوا
هوش مصنوعی

علی‌بابا وزن‌های مدل ۲.۴ تریلیون پارامتری Qwen3.8-Max را آزاد کرد

برای اولین بار یک مدل رده‌ی Max از خانواده‌ی Qwen وزن‌هایش عمومی شد. مدل ۲.۴ تریلیون پارامتر دارد ولی در هر پرسش فقط ۹۵ میلیارد پارامتر فعال می‌شود. مشکل اینجاست که تقریباً هیچ‌کس سخت‌افزار اجرایش را ندارد.

تحریریه زاوینو۲ دقیقه مطالعه

Read this story in English

علی‌بابا وزن‌های مدل ۲.۴ تریلیون پارامتری Qwen3.8-Max را آزاد کرد

شرکت علی‌بابا سیزدهم آگوست وزن‌های مدل Qwen3.8-Max را روی Hugging Face منتشر کرد. این اولین باری است که یک مدل رده‌ی Max از این خانواده به‌صورت open-weights بیرون می‌آید.

عدد اصلی ماجرا بزرگ است: ۲.۴ تریلیون پارامتر.

اما این عدد کل ماجرا نیست

معماری این مدل زبانی از نوع MoE یا Mixture-of-Experts است. یعنی با اینکه کل مدل ۲.۴ تریلیون پارامتر دارد، برای هر پرسش فقط حدود ۹۵ میلیارد پارامتر فعال می‌شود.

این تفاوت خیلی مهم است. مدل کیفیت یک مدل غول‌پیکر را دارد، ولی هزینه‌ی محاسباتی هر پرسش به‌مراتب کمتر از یک مدل ۲.۴ تریلیونی متراکم است.

پنجره‌ی متن هم ۱ میلیون توکن است و مدل ورودی متن، تصویر و ویدیو را قبول می‌کند.

مشکل بزرگ: چه کسی می‌تواند اجرایش کند؟

اینجا جایی است که خوش‌بینی کمی فروکش می‌کند. «متن‌باز بودن» یعنی وزن‌ها را می‌توانی دانلود کنی، نه اینکه بتوانی اجرایش کنی.

برای بالا آوردن یک مدل در این مقیاس به خوشه‌ای از GPUهای گران‌قیمت نیاز داری. عملاً تعداد تیم‌هایی که می‌توانند این کار را بکنند در دنیا خیلی محدود است.

به همین دلیل علی‌بابا یک نسخه‌ی کوچک‌تر هم داده: Qwen3.8-27B. این یکی روی سخت‌افزار معمولی‌تر قابل استفاده است و احتمالاً همان چیزی است که بیشتر آدم‌ها واقعاً از آن استفاده خواهند کرد.

لایسنس عوض شده

یک نکته که راحت از چشم می‌افتد: این مدل دیگر زیر لایسنس Apache 2.0 منتشر نشده.

هم Qwen3.8 و هم Kimi K3 به لایسنس‌های اختصاصی رفته‌اند که برای محصولات تجاری در مقیاس بزرگ و کسب‌وکارهای MaaS شرط اجازه‌ی جداگانه می‌گذارند.

برای پژوهش و پروژه‌های کوچک فرقی نمی‌کند. اگر می‌خواهی رویش سرویس تجاری بزرگ بسازی، باید متن لایسنس را بخوانی.

تصویر بزرگ‌تر

جالب اینجاست که آزمایشگاه‌های چینی دارند به‌سرعت به یک الگوی مشترک می‌رسند: مدل عظیم MoE، پنجره‌ی متن میلیونی، وزن‌های باز، و لایسنسی که تجاری‌سازی در مقیاس بزرگ را کنترل می‌کند. مدل GLM-5.3 شرکت Zhipu و هارنس تازه‌ی دیپ‌سیک هم دقیقاً همین مسیر را می‌روند.

این دقیقاً همان نقطه‌ای است که آزمایشگاه‌های آمریکایی وزن‌هایشان را نمی‌دهند. 🤖

منابع

هم‌رسانی

خبرهای مرتبط

همه

خبرنامه

هر هفته مهم‌ترین اتفاق‌های هوش مصنوعی و تکنولوژی، خلاصه و بدون حاشیه، در ایمیلت.

هر وقت خواستی می‌توانی لغو عضویت کنی.