Qwen 3.8 Max: بررسی کامل، بنچمارکها و مقایسهی هزینه با مدلهای پرچمدار
خانوادهی کوئن این هفته بزرگترین عضو خود را معرفی کرد: Qwen 3.8 Max، یک مدل زبانی بزرگ با ۲٫۴ تریلیون پارامتر و حافظهی گفتوگوی یکمیلیونتوکنی. اما عدد بزرگ بهتنهایی چیزی ثابت نمیکند. در این مقاله سه پرسش را جدا از هم جواب میدهیم: این مدل چطور ساخته شده، در سنجههای مستقل کجا ایستاده، و — پرسشی که معمولاً از قلم میافتد — هزینهاش نسبت به بقیهی پرچمداران چقدر است.
Qwen 3.8 Max دقیقاً چیست؟
کوئن خانوادهی مدلهای زبانی شرکت علیباباست و «Max» همیشه پرقدرتترین عضو هر نسل بوده است. نسخهی ۳٫۸ اما یک جهش اندازهای است، نه یک بهروزرسانی جزئی:
- ۲٫۴ تریلیون پارامتر کل — بزرگترین مدلی که این خانواده تا امروز منتشر کرده است.
- حدود ۹۵ میلیارد پارامتر فعال در هر درخواست؛ یعنی فقط بخش کوچکی از آن غول برای هر پاسخ روشن میشود.
- پنجرهی متن ۱ میلیون توکن — در عمل تا حدود ۹۹۱ هزار توکن ورودی (و ۹۸۳ هزار وقتی حالت استدلال روشن باشد).
- خروجی تا ۱۳۱ هزار توکن در یک پاسخ، با بودجهی استدلال داخلی تا ۲۶۲ هزار توکن.
- پشتیبانی از فراخوانی ابزار، خروجی ساختاریافته و تکمیل پیشوندی — یعنی برای کارهای عاملی (agentic) طراحی شده، نه فقط پرسشوپاسخ.
سازنده همچنین اعلام کرده که برای نخستین بار وزنهای یک مدل ردهی Max را منتشر خواهد کرد؛ نسخهی کوچکتر ۲۷ میلیاردی هم در همان مسیر است.
معماری MoE: چرا ۲٫۴ تریلیون پارامتر لزوماً گران نیست
کلید فهم این مدل، تفاوت «پارامتر کل» با «پارامتر فعال» است. Qwen 3.8 Max یک معماری ترکیب متخصصها (Mixture of Experts) دارد: بهجای اینکه کل شبکه برای هر توکن محاسبه شود، یک مسیریاب تصمیم میگیرد کدام زیرمجموعهی کوچک از «متخصصها» برای این ورودی مناسب است و فقط همانها را فعال میکند.
نتیجهی عملی این است که مدل دانش و ظرفیت یک شبکهی ۲٫۴ تریلیونی را دارد، ولی هزینهی محاسباتی هر درخواست نزدیک به یک مدل ۹۵ میلیاردی است. این دقیقاً همان چیزی است که اجازه میدهد یک مدل در این اندازه، قیمتی در ردهی مدلهای بهمراتب کوچکتر داشته باشد — نکتهای که در بخش هزینه دوباره به آن برمیگردیم.
عدد پارامتر کل، اندازهی کتابخانه است؛ عدد پارامتر فعال، تعداد کتابهایی که برای پاسخدادن به شما باز میشود. هزینه را دومی تعیین میکند، نه اولی.
— تیم هوشواره
کارنامهی بنچمارکها: کجا جلو، کجا عقب
سنجههای منتشرشده تصویر روشنی میدهند و — برخلاف بیشتر معرفیهای محصول — تصویر یکدستی نیست. این مدل در یک دستهی مشخص پیشرو است و در دستهای دیگر عقب میماند.
جایی که پیشتاز است: کارهای عاملی و اسناد
| سنجه | چه میسنجد | امتیاز |
|---|---|---|
| OSWorld-Verified | کار با محیط کامپیوتر مثل یک کاربر | ۸۶٫۱ |
| Terminal-Bench 2.1 | کار در خط فرمان | ۸۶٫۶ |
| PaperBench | فهم و بازتولید مقالههای علمی | ۹۳٫۰ |
| GPQA Diamond | پرسشهای علمی سطح دکتری | ۹۲٫۶ |
| OmniDocBench 1.5 | درک اسناد و مدارک | ۹۲٫۱ |
| IFBench | پیروی دقیق از دستورالعمل | ۸۲٫۸ |
در OSWorld-Verified — که سنجهی کار عاملی با محیط کامپیوتر است — این مدل از پرچمداران رقیب جلو میزند (۸۶٫۱ در برابر ۸۵٫۰ و ۸۳٫۲ برای دو مدل مطرح دیگر، و ۷۶٫۲ برای ردهی Pro خانوادهی جمینای). در Terminal-Bench هم بالاتر از ردهی Opus خانوادهی کلاد میایستد و فقط اندکی از صدرنشین عقب است.
جایی که عقب است: مهندسی نرمافزار سنگین
روی SWE-bench Pro — سختترین سنجهی رفع باگ در مخازن واقعی — امتیاز ۶۷٫۷ میگیرد: بالاتر از یکی از پرچمداران (۶۴٫۶)، کمی پایینتر از دیگری (۶۹٫۲)، و با فاصلهی معنادار پشت سر صدرنشین (۸۰٫۰). در آزمون HLE هم ۴۳٫۶ در برابر ۵۳٫۳ صدرنشین میگیرد. پس این مدل صدرنشین مطلق نیست و ادعایش هم این نیست.
آنچه بیشتر از رتبهها جلب توجه میکند، شیب پیشرفت نسبت به نسل قبلی همین خانواده است: FrontierSWE از ۴۰٫۷ به ۷۳٫۵، DeepSWE از ۲۱٫۶ به ۵۶٫۶ و JobBench از ۳۱٫۳ به ۵۳٫۴ رسیده — یعنی در یک نسل، فاصلهی خودش با ردهی بالا را تقریباً نصف کرده است.
مقایسهی هزینه: جایی که تفاوت واقعاً بزرگ است
اگر فقط یک بخش از این مقاله را میخوانید، همین است. تفاوت این مدل با پرچمداران در کیفیت، چند درصد است؛ در هزینه، چند برابر.
برای اینکه مقایسه معنادار باشد، بهجای عدد مطلق از شاخص نسبی استفاده میکنیم: هزینهی Qwen 3.8 Max را برابر ۱ میگیریم و بقیه را نسبت به آن میسنجیم. ستون آخر یک ترکیب واقعگرایانه از گفتوگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی) — چون در عمل شما معمولاً خیلی بیشتر از آنکه بخوانید، مینویسید و متن میفرستید.
| مدل | شاخص ورودی | شاخص خروجی | شاخص گفتوگوی معمول |
|---|---|---|---|
| Qwen 3.8 Max | ۱٫۰ | ۱٫۰ | ۱٫۰۰ |
| Gemini 3.1 Pro | ۱٫۰ | ۲٫۰ | ۱٫۳۸ |
| Claude Sonnet 5 | ۱٫۵ | ۲٫۵ | ۱٫۸۸ |
| Claude Opus 5 | ۲٫۵ | ۴٫۲ | ۳٫۱۳ |
| GPT-5.6 Sol | ۲٫۵ | ۵٫۰ | ۳٫۴۴ |
| Claude Fable 5 | ۵٫۰ | ۸٫۳ | ۶٫۲۵ |
یعنی برای همان گفتوگو، پرهزینهترین پرچمدار این فهرست حدود شش برابر Qwen 3.8 Max خرج برمیدارد. و این در حالی است که فاصلهی امتیازهای بنچمارک، همانطور که دیدیم، در بیشتر ردیفها یکرقمی است.
یک نکتهی مهم برای انصاف
این جدول فقط ردهی پرچمدار را مقایسه میکند. مدلهای سبک و سریع هر خانواده — مثل ردهی Haiku در خانوادهی کلاد — از این هم ارزانترند (شاخص گفتوگوی معمول حدود ۰٫۶). اگر کارتان خلاصهسازی، دستهبندی یا پاسخ کوتاه است، مدل سبک هم ارزانتر است و هم سریعتر. صرفهجویی واقعی از انتخاب ردهی درست میآید، نه از چسبیدن به بزرگترین مدل ممکن.
پرسش درست «کدام مدل قویترین است؟» نیست، «ارزانترین مدلی که کار من را درست انجام میدهد کدام است؟» است. تفاوت این دو پرسش، در صورتحساب ماهانه دیده میشود، نه در جدول بنچمارک.
پنجرهی یک میلیون توکن، و چرا «نرخ ثابت» مهم است
بیشتر مدلهای پرچمدار وقتی متن ورودی از یک آستانه (معمولاً ۲۰۰ هزار توکن) بگذرد، تعرفه را بالا میبرند؛ برای نمونه ردهی Pro خانوادهی جمینای بالای این آستانه تقریباً دو برابر میشود. Qwen 3.8 Max چنین پلهای ندارد: نرخ آن از پنج هزار توکن تا نهصد هزار توکن یکسان است.
این برای یک دستهی مشخص از کارها تفاوت جدی ایجاد میکند: تحلیل قرارداد و اسناد بلند، مرور یک مخزن کد کامل، خلاصهسازی آرشیو مکاتبات، یا هر کاری که در آن بهجای چند صفحه، چند صد صفحه را یکجا جلوی مدل میگذارید. در چنین کارهایی تفاوت هزینه با رقبا از «چند برابر» فراتر میرود.
نکتهی مکمل: خواندن از حافظهی نهان در این مدل حدود یکهشتم قیمت ورودی عادی است. اگر یک سند بلند را یکبار میفرستید و بعد ده پرسش دربارهاش میکنید، ۹ پرسش بعدی عملاً کسری از هزینهی اول را دارند.
پس چهوقت این مدل، چهوقت مدل دیگر؟
جمعبندی عملی، بر پایهی همان دادههای بالا:
- سراغ Qwen 3.8 Max بروید وقتی متن ورودی طولانی است، کار عاملی و چندمرحلهای دارید، با اسناد و مدارک سروکار دارید، یا حجم درخواستتان بالاست و هزینه برایتان تعیینکننده است.
- سراغ پرچمدارِ صدرنشین بروید وقتی مسئلهی مهندسی نرمافزار پیچیده و چندفایلی در کار است، یا کیفیت پاسخ آنقدر حیاتی است که چند برابر هزینه توجیه دارد.
- سراغ مدل سبک بروید برای ترجمهی کوتاه، خلاصه، دستهبندی و پاسخهای روزمره — که بخش بزرگی از کار واقعی همینهاست.
خوبی کار این است که لازم نیست از پیش تصمیم بگیرید. در آرنای مدلها میتوانید همان درخواست واقعی خودتان را همزمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید؛ این مطمئنترین راه است، چون هیچ بنچمارکی جای کار واقعی شما را نمیگیرد.
پرسشهای متداول
آیا Qwen 3.8 Max از GPT و Claude بهتر است؟
نه بهطور مطلق. در کارهای عاملی، کار با محیط کامپیوتر و درک اسناد جلوتر است؛ در مهندسی نرمافزار سنگین و برخی آزمونهای استدلالی عقبتر. تفاوت اصلیاش کیفیت نیست، نسبت کیفیت به هزینه است.
پنجرهی یک میلیون توکن یعنی چه؟
یعنی مدل میتواند در یک گفتوگو تا حدود هفتصد و پنجاه هزار کلمه را همزمان «در ذهن» داشته باشد — چیزی در حدود چند جلد کتاب. برای تحلیل اسناد بلند یا مرور یک پروژهی کامل، این تعیینکننده است.
فارسی را خوب میفهمد؟
این خانواده جزو مدلهای قوی چندزبانه است و در سنجههای پیروی از دستورالعمل امتیاز بالایی دارد، اما هیچ سنجهی عمومیای کیفیت فارسی را جداگانه اندازه نمیگیرد. توصیهی ما ساده است: یک نمونهی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.
«وزنهای باز» چه فرقی برای من دارد؟
برای کاربر پنل، عملاً هیچ — شما مدل را از طریق هوشواره استفاده میکنید و تفاوتی حس نمیکنید. اهمیتش برای اکوسیستم است: انتشار وزنهای یک مدل در این رده معمولاً باعث میشود ظرف چند ماه، مدلهای بازِ کوچکتر و ارزانترِ زیادی بر پایهی آن ساخته شوند.
چطور در هوشواره از آن استفاده کنم؟
مثل هر مدل دیگر: در صفحهی گفتوگو از فهرست مدلها انتخابش کنید. هزینهی هر پاسخ پیش و پس از ارسال بهصورت تومانی نمایش داده میشود. اگر توسعهدهندهاید، از طریق API هم در دسترس است.
جمعبندی
Qwen 3.8 Max بهترین مدل جهان نیست و خودش هم چنین ادعایی ندارد. چیزی که هست، جالبتر است: مدلی که در بیشتر سنجهها فاصلهای یکرقمی با گرانترین پرچمداران دارد، در کارهای عاملی و اسناد از آنها جلو میزند، و این را با کسری از هزینه انجام میدهد. برای بخش بزرگی از کارهای واقعی، این معاملهی خوبی است.
سادهترین راه قضاوت، امتحانکردن با کار خودتان است. فهرست کامل مدلها و تعرفهی تومانی هرکدام در کاتالوگ مدلها و طرحهای اشتراک در صفحهی تعرفهها است. حساب ندارید؟ ثبتنام کمتر از یک دقیقه طول میکشد و میتوانید همین امروز مقایسه را خودتان انجام دهید.