GLM-5.3 Flash: بررسی کامل مدلی که با کسری از هزینه به پرچمداران نزدیک میشود
خانوادهی GLM یک عضو تازه دارد که ادعای غیرمعمولی با خودش میآورد: GLM-5.3 Flash میگوید میشود به پرچمداران نزدیک شد بدون اینکه هزینهی پرچمدار را پرداخت. این نخستین مدل خانوادهی GLM-5 است که ذاتاً چندوجهی ساخته شده — یعنی تصویر را نه از راه یک وصلهی جانبی، بلکه از پایه میفهمد. در این مقاله سه پرسش را جدا از هم جواب میدهیم: چطور اینقدر ارزان درآمده، در سنجهها کجا ایستاده، و این ارزانی دقیقاً کجا به کار شما میآید و کجا نمیآید.
GLM-5.3 Flash دقیقاً چیست؟
یک مدل زبانی بزرگ از شرکت Z.ai، همخانوادهی GLM-5.3 ولی با هدفی کاملاً متفاوت: آن یکی برای بیشترین توان ساخته شد، این یکی برای کمترین هزینه. مشخصات کلیدی:
- ۳۲۰ میلیارد پارامتر کل، اما فقط ۱۸ میلیارد پارامتر فعال در هر درخواست — و همین نسبت است که قیمت را تعیین میکند، نه عدد بزرگتر.
- پنجرهی متن یک میلیون توکن، یعنی همان حافظهی گفتوگوی مدلهای ردهبالا.
- ورودی متن و تصویر — نخستین عضو ذاتاً چندوجهیِ این نسل؛ سند، نمودار، اسکرینشات و حتی ویدیو را میخواند.
- وزنهای باز؛ سازنده مدل را عمومی منتشر کرده است.
- سازنده میگوید پیش از انتشار، مدل را بهصورت ناشناس روی پلتفرمهای عمومی در دسترس گذاشته تا بازخورد واقعی بگیرد و در همان هفته پرکاربردترین مدل آن پلتفرمها شده است.
چطور اینقدر ارزان درآمده؟
ارزانی اینجا نتیجهی یک ترفند نیست، نتیجهی سه تصمیم معماری است که کنار هم کار میکنند. برای فهمیدنش لازم است بدانیم هزینهی یک مدل از کجا میآید: از مقدار محاسبهای که برای هر توکن انجام میدهد، و از حافظهای که برای بهخاطر سپردن گفتوگو اشغال میکند.
- پارامترهای فعالِ کمتر. نسبت به نسل GLM-4.5 با اندازهی کلِ تقریباً برابر، هم پارامتر فعال (۱۸ در برابر ۳۲ میلیارد) و هم تعداد لایهها (۴۵ در برابر ۹۲) تقریباً نصف شده است.
- توجه ترکیبی. بهجای یک سازوکار توجه، دو نوع کنار هم: یکی وابستگیهای نزدیک را ارزان دنبال میکند و دیگری فقط بخشهای مرتبطِ متن دور را بیرون میکشد. نتیجه این است که متن بلند دیگر گران تمام نمیشود.
- فشردهسازی حافظهی گفتوگو. سازنده گزارش میکند نسبت به GLM-5.3، محاسبهی توجه حدود سه برابر و حافظهی نگهداری گفتوگو حدود چهار برابر کمتر شده است.
ترجمهی عملیاش ساده است: مدل برای رسیدن به همان جواب، کار کمتری انجام میدهد — و چیزی که شما میپردازید، در نهایت همان کار است.
عدد پارامتر کل، اندازهی کتابخانه است؛ عدد پارامتر فعال، تعداد کتابهایی که برای پاسخدادن به شما باز میشود. صورتحساب را دومی مینویسد، نه اولی.
— تیم هوشواره
کارنامهی بنچمارکها: کجا جلو، کجا عقب
جدول زیر سنجههایی است که در معرفی رسمی منتشر شد. ستون سوم نسل قبلی همین خانواده است و دو ستون آخر پرچمداران بسته. عددهای بزرگتر بهترند.
| سنجه | GLM-5.3 Flash | GLM-5.2 | Claude Opus 4.8 | GPT-5.6 Terra |
|---|---|---|---|---|
| Terminal-Bench 2.1 | ۸۴٫۳ | ۸۱٫۰ | ۸۵٫۰ | ۸۷٫۴ |
| DeepSWE v1.1 | ۶۳٫۴ | ۴۶٫۲ | ۵۸٫۰ | ۶۹٫۶ |
| NL2Repo | ۵۶٫۳ | ۴۸٫۹ | ۶۹٫۷ | — |
| Toolathlon Verified | ۷۸٫۴ | ۵۹٫۹ | ۷۶٫۲ | ۷۴٫۹ |
| AutomationBench | ۴۸٫۸ | ۲۶٫۲ | ۴۱٫۰ | ۳۷٫۲ |
| Agents' Last Exam | ۲۶٫۳ | ۲۰٫۴ | ۲۷٫۰ | ۲۸٫۰ |
| HLE با ابزار | ۵۵٫۳ | ۵۴٫۷ | ۵۷٫۹ | — |
| GDPval-AA v2 | ۱۷۷۳ | ۱۵۰۴ | ۱۵۸۲ | ۱۵۷۱ |
نسبت به نسل قبل: جهش، آن هم با هزینهی کمتر
در هر هشت ردیف از GLM-5.2 جلوتر است و در چند مورد فاصله بزرگ است: مهندسی نرمافزار عمیق از ۴۶٫۲ به ۶۳٫۴، خودکارسازی کارهای اداری از ۲۶٫۲ به ۴۸٫۸ و کار با ابزارها از ۵۹٫۹ به ۷۸٫۴. نکته اینجاست که این جهش همزمان با کاهش قیمت آمده، نه در ازای آن — و این ترکیب، چیزی است که معمولاً بین دو نسل دیده نمیشود.
کنار پرچمداران: در کارهای عاملی جلو، در کدنویسی سنگین عقب
در سه ردیف بالاتر از هر دو پرچمدار بسته میایستد: در GDPval — که کار را با معیار ارزش شغلی میسنجد — با ۱۷۷۳ بالاترین امتیاز کل جدول را دارد؛ در کار با ابزارها با ۷۸٫۴ و در خودکارسازی با ۴۸٫۸ هم اول است.
در مقابل، در کدنویسی سنگین عقب میماند: در NL2Repo امتیاز ۵۶٫۳ در برابر ۶۹٫۷ و در کار خط فرمان ۸۴٫۳ در برابر ۸۷٫۴. پس این مدل صدرنشین مطلق نیست و ادعایش هم این نیست؛ ادعایش نسبتِ کیفیت به هزینه است.
تازهترین توانایی: این مدل میبیند
مهمترین تفاوت این نسخه با بقیهی خانواده، بینایی است. و برخلاف انتظار، قویترین نتایجش در جایی نیست که عکس تفریحی تحلیل کند — در کار اداری است:
| سنجهی بینایی | GLM-5.3 Flash | Claude Opus 4.8 | Gemini 3.7 Flash |
|---|---|---|---|
| OfficeQA Pro — درک اسناد اداری | ۶۲٫۴ | ۴۸٫۹ | — |
| Chartography — خواندن نمودار | ۷۸٫۰ | ۷۵٫۰ | ۶۵٫۰ |
| CharXiv — استدلال روی نمودار | ۸۹٫۴ | ۸۹٫۹ | ۸۸٫۷ |
| MMVU — درک ویدیو | ۸۰٫۵ | ۶۷٫۴ | ۸۲٫۳ |
| BabyVision — ادراک پایه | ۵۳٫۴ | ۴۶٫۸ | ۷۰٫۹ |
ردیف اول از همه گویاتر است: در درک اسناد اداری (فاکتور، گزارش، جدولهای مالی) با اختلاف معناداری از پرچمدار بسته جلو میزند. در خواندن و استدلال روی نمودار هم در صدر یا همردهٔ صدر است. در مقابل، در ادراک بصری پایه و درک ویدیو از مدل تخصصی رقیب عقبتر است.
یعنی اگر کارتان «این گزارش را بخوان و خلاصه کن» یا «از این نمودار عدد دربیاور» است، این مدل انتخاب بسیار خوبی است؛ اگر کارتان تحلیل عمیق ویدیو است، جای دیگری را نگاه کنید.
«چندوجهی» یک برچسب بازاریابی شده است. پرسش درست این نیست که مدل تصویر را میپذیرد یا نه — تقریباً همه میپذیرند. پرسش این است که روی کدام نوع تصویر خوب است. همانطور که جدول بالا نشان میدهد، یک مدل میتواند در خواندن سند سرآمد باشد و در فهم ویدیو معمولی.
مقایسهی هزینه: جایی که تفاوت از چند درصد به چند برابر میرسد
برای اینکه مقایسه معنادار باشد، بهجای عدد مطلق از شاخص نسبی استفاده میکنیم: هزینهی GLM-5.3 Flash را برابر ۱ میگیریم و بقیه را نسبت به آن میسنجیم. ستون آخر یک ترکیب واقعگرایانه از گفتوگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی)، چون در عمل معمولاً خیلی بیشتر از آنکه بخوانید، متن میفرستید.
| مدل | شاخص ورودی | شاخص خروجی | شاخص گفتوگوی معمول |
|---|---|---|---|
| GLM-5.3 Flash | ۱٫۰ | ۱٫۰ | ۱٫۰۰ |
| DeepSeek V4 Flash | ۰٫۵۹ | ۰٫۳۵ | ۰٫۵۰ |
| Gemini 3.7 Flash | ۵٫۰ | ۷٫۵ | ۶٫۰۰ |
| GLM-5.2 (نسل قبل) | ۱٫۹ | ۱٫۸ | ۱٫۸۲ |
| Claude Haiku 4.5 | ۶٫۷ | ۱۰٫۰ | ۸٫۰۰ |
| GLM-5.3 | ۹٫۳ | ۸٫۸ | ۹٫۱۲ |
| Claude Opus 4.8 | ۳۳٫۳ | ۵۰٫۰ | ۴۰٫۰۰ |
این جدول را با جدول بنچمارک کنار هم بگذارید، چون تنها با هم معنا میدهند. فاصلهی امتیازها در بیشتر ردیفها یکرقمی بود؛ فاصلهی هزینهها دهها برابر است. گرانترین گزینهی این فهرست برای همان گفتوگو حدود چهل برابر خرج برمیدارد.
دو نکته برای انصاف: اول اینکه نسبت به نسل قبلی خودش هم حدود دو برابر ارزانتر است، پس اگر روی GLM-5.2 چیزی ساختهاید، این تقریباً همیشه ارتقای درستی است. دوم اینکه ارزانترین گزینهی جدول این مدل نیست — چند مدل سبکِ دیگر همرده یا کمی ارزانترند و اگر کارتان واقعاً ساده است باید آنها را هم بسنجید. یک تذکر لازم هم اینکه این جدول عکسِ لحظهای تعرفههاست و تعرفهها تغییر میکنند؛ ارقام این جدول در ۱۹ شهریور ۱۴۰۵ بازبینی شدهاند؛ مرجع همیشگی، عدد بهروزِ هر مدل در کاتالوگ مدلهاست.
پس چهوقت این مدل، چهوقت مدل دیگر؟
- سراغ GLM-5.3 Flash بروید وقتی حجم درخواستتان بالاست و هزینه تعیینکننده است، کار عاملی و چندمرحلهای دارید، با اسناد و نمودار سروکار دارید، یا متن ورودیتان بلند است. برای بیشتر کارهای روزمره، این گزینهی پیشفرضِ سنجیدهای است.
- سراغ GLM-5.3 یا یک پرچمدار بسته بروید وقتی مسئلهی مهندسی نرمافزارِ سنگین و چندفایلی در کار است — همان دو ردیفی که جدول بالا صریحاً نشان میدهد عقب است — و کیفیت آنقدر حیاتی است که چند برابر هزینه توجیه دارد.
- سراغ یک مدل تخصصی بروید برای تحلیل عمیق ویدیو، که تنها دستهای است که این مدل در آن بهروشنی دنبالرو است.
لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدلها همان درخواست واقعی خودتان را همزمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید؛ این مطمئنترین راه است، چون هیچ بنچمارکی جای کار واقعی شما را نمیگیرد.
پرسشهای متداول
آیا GLM-5.3 Flash از GLM-5.3 بهتر است؟
نه — ارزانتر است، نه بهتر. در کارهای عاملی و اسناد نتایج نزدیک یا بهتری میگیرد، ولی در کدنویسی سنگین GLM-5.3 جلوتر است. تفاوت واقعی در قیمت است: Flash حدود یکنهمِ آن هزینه دارد. برای بیشتر کارها این معاملهی خوبی است، برای کدنویسی پیچیده لزوماً نه.
«۳۲۰ میلیارد پارامتر ولی ۱۸ میلیارد فعال» یعنی چه؟
یعنی مدل دانش یک شبکهی بسیار بزرگ را دارد، اما برای هر پاسخ فقط بخش کوچکی از آن روشن میشود. هزینه و سرعت را همان بخش کوچک تعیین میکند — به همین دلیل مدلی به این بزرگی میتواند قیمتی در ردهی مدلهای سبک داشته باشد.
تصویر را واقعاً میفهمد یا فقط قبول میکند؟
واقعاً میفهمد، ولی نه در همهی زمینهها یکسان. در خواندن سند و نمودار جزو بهترینهاست و حتی از پرچمداران بسته جلو میزند؛ در ادراک بصری پایه و ویدیو متوسط است. جدول بینایی در همین مقاله تفکیکش را نشان میدهد.
فارسی را خوب میفهمد؟
این خانواده در سنجههای چندزبانه امتیاز خوبی دارد، اما هیچ سنجهی عمومیای کیفیت فارسی را جداگانه اندازه نمیگیرد. توصیهی ما ساده است: یک نمونهی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.
چطور در هوشواره از آن استفاده کنم؟
مثل هر مدل دیگر: در صفحهی گفتوگو از فهرست مدلها انتخابش کنید و در صورت نیاز تصویر را هم به گفتوگو اضافه کنید. هزینهی هر پاسخ پیش و پس از ارسال بهصورت تومانی نمایش داده میشود. اگر توسعهدهندهاید، از طریق API هم در دسترس است.
جمعبندی
GLM-5.3 Flash بهترین مدل جهان نیست و چنین ادعایی هم ندارد. چیزی که هست جالبتر است: مدلی که در کارهای عاملی و درک اسناد از پرچمداران گرانتر جلو میزند، در کدنویسی سنگین پشت سرشان میماند، تصویر را از پایه میفهمد، و همهی اینها را با کسری از هزینه انجام میدهد. برای بخش بزرگی از کار واقعی، این دقیقاً همان نقطهای است که باید از آن شروع کرد.
سادهترین راه قضاوت، امتحانکردن با کار خودتان است. فهرست کامل مدلها و تعرفهی تومانی هرکدام در کاتالوگ مدلها و طرحهای اشتراک در صفحهی تعرفهها است. حساب ندارید؟ ثبتنام کمتر از یک دقیقه طول میکشد و میتوانید همین امروز مقایسه را خودتان انجام دهید.