Qwen 3.8 Max: بررسی کامل، بنچمارک‌ها و مقایسه‌ی هزینه با مدل‌های پرچم‌دار

Qwen 3.8 Max: بررسی کامل، بنچمارک‌ها و مقایسه‌ی هزینه با مدل‌های پرچم‌دار

Qwen 3.8 Max کوئن مدل زبانی بزرگ مقایسه مدل‌های هوش مصنوعی هزینه هوش مصنوعی بنچمارک هوش مصنوعی پنجره متن یک میلیون توکن

خانواده‌ی کوئن این هفته بزرگ‌ترین عضو خود را معرفی کرد: Qwen 3.8 Max، یک مدل زبانی بزرگ با ۲٫۴ تریلیون پارامتر و حافظه‌ی گفت‌وگوی یک‌میلیون‌توکنی. اما عدد بزرگ به‌تنهایی چیزی ثابت نمی‌کند. در این مقاله سه پرسش را جدا از هم جواب می‌دهیم: این مدل چطور ساخته شده، در سنجه‌های مستقل کجا ایستاده، و — پرسشی که معمولاً از قلم می‌افتد — هزینه‌اش نسبت به بقیه‌ی پرچم‌داران چقدر است.

Qwen 3.8 Max دقیقاً چیست؟

کوئن خانواده‌ی مدل‌های زبانی شرکت علی‌باباست و «Max» همیشه پرقدرت‌ترین عضو هر نسل بوده است. نسخه‌ی ۳٫۸ اما یک جهش اندازه‌ای است، نه یک به‌روزرسانی جزئی:

  • ۲٫۴ تریلیون پارامتر کل — بزرگ‌ترین مدلی که این خانواده تا امروز منتشر کرده است.
  • حدود ۹۵ میلیارد پارامتر فعال در هر درخواست؛ یعنی فقط بخش کوچکی از آن غول برای هر پاسخ روشن می‌شود.
  • پنجره‌ی متن ۱ میلیون توکن — در عمل تا حدود ۹۹۱ هزار توکن ورودی (و ۹۸۳ هزار وقتی حالت استدلال روشن باشد).
  • خروجی تا ۱۳۱ هزار توکن در یک پاسخ، با بودجه‌ی استدلال داخلی تا ۲۶۲ هزار توکن.
  • پشتیبانی از فراخوانی ابزار، خروجی ساختاریافته و تکمیل پیشوندی — یعنی برای کارهای عاملی (agentic) طراحی شده، نه فقط پرسش‌وپاسخ.

سازنده همچنین اعلام کرده که برای نخستین بار وزن‌های یک مدل رده‌ی Max را منتشر خواهد کرد؛ نسخه‌ی کوچک‌تر ۲۷ میلیاردی هم در همان مسیر است.

معماری MoE: چرا ۲٫۴ تریلیون پارامتر لزوماً گران نیست

کلید فهم این مدل، تفاوت «پارامتر کل» با «پارامتر فعال» است. Qwen 3.8 Max یک معماری ترکیب متخصص‌ها (Mixture of Experts) دارد: به‌جای اینکه کل شبکه برای هر توکن محاسبه شود، یک مسیریاب تصمیم می‌گیرد کدام زیرمجموعه‌ی کوچک از «متخصص‌ها» برای این ورودی مناسب است و فقط همان‌ها را فعال می‌کند.

نتیجه‌ی عملی این است که مدل دانش و ظرفیت یک شبکه‌ی ۲٫۴ تریلیونی را دارد، ولی هزینه‌ی محاسباتی هر درخواست نزدیک به یک مدل ۹۵ میلیاردی است. این دقیقاً همان چیزی است که اجازه می‌دهد یک مدل در این اندازه، قیمتی در رده‌ی مدل‌های به‌مراتب کوچک‌تر داشته باشد — نکته‌ای که در بخش هزینه دوباره به آن برمی‌گردیم.

عدد پارامتر کل، اندازه‌ی کتابخانه است؛ عدد پارامتر فعال، تعداد کتاب‌هایی که برای پاسخ‌دادن به شما باز می‌شود. هزینه را دومی تعیین می‌کند، نه اولی.

— تیم هوشواره

کارنامه‌ی بنچمارک‌ها: کجا جلو، کجا عقب

سنجه‌های منتشرشده تصویر روشنی می‌دهند و — برخلاف بیشتر معرفی‌های محصول — تصویر یکدستی نیست. این مدل در یک دسته‌ی مشخص پیشرو است و در دسته‌ای دیگر عقب می‌ماند.

جایی که پیشتاز است: کارهای عاملی و اسناد

سنجهچه می‌سنجدامتیاز
OSWorld-Verifiedکار با محیط کامپیوتر مثل یک کاربر۸۶٫۱
Terminal-Bench 2.1کار در خط فرمان۸۶٫۶
PaperBenchفهم و بازتولید مقاله‌های علمی۹۳٫۰
GPQA Diamondپرسش‌های علمی سطح دکتری۹۲٫۶
OmniDocBench 1.5درک اسناد و مدارک۹۲٫۱
IFBenchپیروی دقیق از دستورالعمل۸۲٫۸

در OSWorld-Verified — که سنجه‌ی کار عاملی با محیط کامپیوتر است — این مدل از پرچم‌داران رقیب جلو می‌زند (۸۶٫۱ در برابر ۸۵٫۰ و ۸۳٫۲ برای دو مدل مطرح دیگر، و ۷۶٫۲ برای رده‌ی Pro خانواده‌ی جمینای). در Terminal-Bench هم بالاتر از رده‌ی Opus خانواده‌ی کلاد می‌ایستد و فقط اندکی از صدرنشین عقب است.

جایی که عقب است: مهندسی نرم‌افزار سنگین

روی SWE-bench Pro — سخت‌ترین سنجه‌ی رفع باگ در مخازن واقعی — امتیاز ۶۷٫۷ می‌گیرد: بالاتر از یکی از پرچم‌داران (۶۴٫۶)، کمی پایین‌تر از دیگری (۶۹٫۲)، و با فاصله‌ی معنادار پشت سر صدرنشین (۸۰٫۰). در آزمون HLE هم ۴۳٫۶ در برابر ۵۳٫۳ صدرنشین می‌گیرد. پس این مدل صدرنشین مطلق نیست و ادعایش هم این نیست.

آنچه بیشتر از رتبه‌ها جلب توجه می‌کند، شیب پیشرفت نسبت به نسل قبلی همین خانواده است: FrontierSWE از ۴۰٫۷ به ۷۳٫۵، DeepSWE از ۲۱٫۶ به ۵۶٫۶ و JobBench از ۳۱٫۳ به ۵۳٫۴ رسیده — یعنی در یک نسل، فاصله‌ی خودش با رده‌ی بالا را تقریباً نصف کرده است.

مقایسه‌ی هزینه: جایی که تفاوت واقعاً بزرگ است

اگر فقط یک بخش از این مقاله را می‌خوانید، همین است. تفاوت این مدل با پرچم‌داران در کیفیت، چند درصد است؛ در هزینه، چند برابر.

برای اینکه مقایسه معنادار باشد، به‌جای عدد مطلق از شاخص نسبی استفاده می‌کنیم: هزینه‌ی Qwen 3.8 Max را برابر ۱ می‌گیریم و بقیه را نسبت به آن می‌سنجیم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی) — چون در عمل شما معمولاً خیلی بیشتر از آنکه بخوانید، می‌نویسید و متن می‌فرستید.

مدلشاخص ورودیشاخص خروجیشاخص گفت‌وگوی معمول
Qwen 3.8 Max۱٫۰۱٫۰۱٫۰۰
Gemini 3.1 Pro۱٫۰۲٫۰۱٫۳۸
Claude Sonnet 5۱٫۵۲٫۵۱٫۸۸
Claude Opus 5۲٫۵۴٫۲۳٫۱۳
GPT-5.6 Sol۲٫۵۵٫۰۳٫۴۴
Claude Fable 5۵٫۰۸٫۳۶٫۲۵

یعنی برای همان گفت‌وگو، پرهزینه‌ترین پرچم‌دار این فهرست حدود شش برابر Qwen 3.8 Max خرج برمی‌دارد. و این در حالی است که فاصله‌ی امتیازهای بنچمارک، همان‌طور که دیدیم، در بیشتر ردیف‌ها یک‌رقمی است.

یک نکته‌ی مهم برای انصاف

این جدول فقط رده‌ی پرچم‌دار را مقایسه می‌کند. مدل‌های سبک و سریع هر خانواده — مثل رده‌ی Haiku در خانواده‌ی کلاد — از این هم ارزان‌ترند (شاخص گفت‌وگوی معمول حدود ۰٫۶). اگر کارتان خلاصه‌سازی، دسته‌بندی یا پاسخ کوتاه است، مدل سبک هم ارزان‌تر است و هم سریع‌تر. صرفه‌جویی واقعی از انتخاب رده‌ی درست می‌آید، نه از چسبیدن به بزرگ‌ترین مدل ممکن.

پرسش درست «کدام مدل قوی‌ترین است؟» نیست، «ارزان‌ترین مدلی که کار من را درست انجام می‌دهد کدام است؟» است. تفاوت این دو پرسش، در صورت‌حساب ماهانه دیده می‌شود، نه در جدول بنچمارک.

پنجره‌ی یک میلیون توکن، و چرا «نرخ ثابت» مهم است

بیشتر مدل‌های پرچم‌دار وقتی متن ورودی از یک آستانه (معمولاً ۲۰۰ هزار توکن) بگذرد، تعرفه را بالا می‌برند؛ برای نمونه رده‌ی Pro خانواده‌ی جمینای بالای این آستانه تقریباً دو برابر می‌شود. Qwen 3.8 Max چنین پله‌ای ندارد: نرخ آن از پنج هزار توکن تا نهصد هزار توکن یکسان است.

این برای یک دسته‌ی مشخص از کارها تفاوت جدی ایجاد می‌کند: تحلیل قرارداد و اسناد بلند، مرور یک مخزن کد کامل، خلاصه‌سازی آرشیو مکاتبات، یا هر کاری که در آن به‌جای چند صفحه، چند صد صفحه را یک‌جا جلوی مدل می‌گذارید. در چنین کارهایی تفاوت هزینه با رقبا از «چند برابر» فراتر می‌رود.

نکته‌ی مکمل: خواندن از حافظه‌ی نهان در این مدل حدود یک‌هشتم قیمت ورودی عادی است. اگر یک سند بلند را یک‌بار می‌فرستید و بعد ده پرسش درباره‌اش می‌کنید، ۹ پرسش بعدی عملاً کسری از هزینه‌ی اول را دارند.

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

جمع‌بندی عملی، بر پایه‌ی همان داده‌های بالا:

  • سراغ Qwen 3.8 Max بروید وقتی متن ورودی طولانی است، کار عاملی و چندمرحله‌ای دارید، با اسناد و مدارک سروکار دارید، یا حجم درخواست‌تان بالاست و هزینه برایتان تعیین‌کننده است.
  • سراغ پرچم‌دارِ صدرنشین بروید وقتی مسئله‌ی مهندسی نرم‌افزار پیچیده و چندفایلی در کار است، یا کیفیت پاسخ آن‌قدر حیاتی است که چند برابر هزینه توجیه دارد.
  • سراغ مدل سبک بروید برای ترجمه‌ی کوتاه، خلاصه، دسته‌بندی و پاسخ‌های روزمره — که بخش بزرگی از کار واقعی همین‌هاست.

خوبی کار این است که لازم نیست از پیش تصمیم بگیرید. در آرنای مدل‌ها می‌توانید همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید؛ این مطمئن‌ترین راه است، چون هیچ بنچمارکی جای کار واقعی شما را نمی‌گیرد.

پرسش‌های متداول

آیا Qwen 3.8 Max از GPT و Claude بهتر است؟

نه به‌طور مطلق. در کارهای عاملی، کار با محیط کامپیوتر و درک اسناد جلوتر است؛ در مهندسی نرم‌افزار سنگین و برخی آزمون‌های استدلالی عقب‌تر. تفاوت اصلی‌اش کیفیت نیست، نسبت کیفیت به هزینه است.

پنجره‌ی یک میلیون توکن یعنی چه؟

یعنی مدل می‌تواند در یک گفت‌وگو تا حدود هفتصد و پنجاه هزار کلمه را هم‌زمان «در ذهن» داشته باشد — چیزی در حدود چند جلد کتاب. برای تحلیل اسناد بلند یا مرور یک پروژه‌ی کامل، این تعیین‌کننده است.

فارسی را خوب می‌فهمد؟

این خانواده جزو مدل‌های قوی چندزبانه است و در سنجه‌های پیروی از دستورالعمل امتیاز بالایی دارد، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

«وزن‌های باز» چه فرقی برای من دارد؟

برای کاربر پنل، عملاً هیچ — شما مدل را از طریق هوشواره استفاده می‌کنید و تفاوتی حس نمی‌کنید. اهمیتش برای اکوسیستم است: انتشار وزن‌های یک مدل در این رده معمولاً باعث می‌شود ظرف چند ماه، مدل‌های بازِ کوچک‌تر و ارزان‌ترِ زیادی بر پایه‌ی آن ساخته شوند.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

Qwen 3.8 Max بهترین مدل جهان نیست و خودش هم چنین ادعایی ندارد. چیزی که هست، جالب‌تر است: مدلی که در بیشتر سنجه‌ها فاصله‌ای یک‌رقمی با گران‌ترین پرچم‌داران دارد، در کارهای عاملی و اسناد از آن‌ها جلو می‌زند، و این را با کسری از هزینه انجام می‌دهد. برای بخش بزرگی از کارهای واقعی، این معامله‌ی خوبی است.

ساده‌ترین راه قضاوت، امتحان‌کردن با کار خودتان است. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد و می‌توانید همین امروز مقایسه را خودتان انجام دهید.

مطالب دیگر