GLM-5.3 Flash: بررسی کامل مدلی که با کسری از هزینه به پرچم‌داران نزدیک می‌شود

خانواده‌ی GLM یک عضو تازه دارد که ادعای غیرمعمولی با خودش می‌آورد: GLM-5.3 Flash می‌گوید می‌شود به پرچم‌داران نزدیک شد بدون اینکه هزینه‌ی پرچم‌دار را پرداخت. این نخستین مدل خانواده‌ی GLM-5 است که ذاتاً چندوجهی ساخته شده — یعنی تصویر را نه از راه یک وصله‌ی جانبی، بلکه از پایه می‌فهمد. در این مقاله سه پرسش را جدا از هم جواب می‌دهیم: چطور این‌قدر ارزان درآمده، در سنجه‌ها کجا ایستاده، و این ارزانی دقیقاً کجا به کار شما می‌آید و کجا نمی‌آید.

GLM-5.3 Flash دقیقاً چیست؟

یک مدل زبانی بزرگ از شرکت Z.ai، هم‌خانواده‌ی GLM-5.3 ولی با هدفی کاملاً متفاوت: آن یکی برای بیشترین توان ساخته شد، این یکی برای کمترین هزینه. مشخصات کلیدی:

  • ۳۲۰ میلیارد پارامتر کل، اما فقط ۱۸ میلیارد پارامتر فعال در هر درخواست — و همین نسبت است که قیمت را تعیین می‌کند، نه عدد بزرگ‌تر.
  • پنجره‌ی متن یک میلیون توکن، یعنی همان حافظه‌ی گفت‌وگوی مدل‌های رده‌بالا.
  • ورودی متن و تصویر — نخستین عضو ذاتاً چندوجهیِ این نسل؛ سند، نمودار، اسکرین‌شات و حتی ویدیو را می‌خواند.
  • وزن‌های باز؛ سازنده مدل را عمومی منتشر کرده است.
  • سازنده می‌گوید پیش از انتشار، مدل را به‌صورت ناشناس روی پلتفرم‌های عمومی در دسترس گذاشته تا بازخورد واقعی بگیرد و در همان هفته پرکاربردترین مدل آن پلتفرم‌ها شده است.

چطور این‌قدر ارزان درآمده؟

ارزانی اینجا نتیجه‌ی یک ترفند نیست، نتیجه‌ی سه تصمیم معماری است که کنار هم کار می‌کنند. برای فهمیدنش لازم است بدانیم هزینه‌ی یک مدل از کجا می‌آید: از مقدار محاسبه‌ای که برای هر توکن انجام می‌دهد، و از حافظه‌ای که برای به‌خاطر سپردن گفت‌وگو اشغال می‌کند.

  • پارامترهای فعالِ کمتر. نسبت به نسل GLM-4.5 با اندازه‌ی کلِ تقریباً برابر، هم پارامتر فعال (۱۸ در برابر ۳۲ میلیارد) و هم تعداد لایه‌ها (۴۵ در برابر ۹۲) تقریباً نصف شده است.
  • توجه ترکیبی. به‌جای یک سازوکار توجه، دو نوع کنار هم: یکی وابستگی‌های نزدیک را ارزان دنبال می‌کند و دیگری فقط بخش‌های مرتبطِ متن دور را بیرون می‌کشد. نتیجه این است که متن بلند دیگر گران تمام نمی‌شود.
  • فشرده‌سازی حافظه‌ی گفت‌وگو. سازنده گزارش می‌کند نسبت به GLM-5.3، محاسبه‌ی توجه حدود سه برابر و حافظه‌ی نگهداری گفت‌وگو حدود چهار برابر کمتر شده است.

ترجمه‌ی عملی‌اش ساده است: مدل برای رسیدن به همان جواب، کار کمتری انجام می‌دهد — و چیزی که شما می‌پردازید، در نهایت همان کار است.

عدد پارامتر کل، اندازه‌ی کتابخانه است؛ عدد پارامتر فعال، تعداد کتاب‌هایی که برای پاسخ‌دادن به شما باز می‌شود. صورت‌حساب را دومی می‌نویسد، نه اولی.

— تیم هوشواره

کارنامه‌ی بنچمارک‌ها: کجا جلو، کجا عقب

جدول زیر سنجه‌هایی است که در معرفی رسمی منتشر شد. ستون سوم نسل قبلی همین خانواده است و دو ستون آخر پرچم‌داران بسته. عددهای بزرگ‌تر بهترند.

سنجهGLM-5.3 FlashGLM-5.2Claude Opus 4.8GPT-5.6 Terra
Terminal-Bench 2.1۸۴٫۳۸۱٫۰۸۵٫۰۸۷٫۴
DeepSWE v1.1۶۳٫۴۴۶٫۲۵۸٫۰۶۹٫۶
NL2Repo۵۶٫۳۴۸٫۹۶۹٫۷
Toolathlon Verified۷۸٫۴۵۹٫۹۷۶٫۲۷۴٫۹
AutomationBench۴۸٫۸۲۶٫۲۴۱٫۰۳۷٫۲
Agents' Last Exam۲۶٫۳۲۰٫۴۲۷٫۰۲۸٫۰
HLE با ابزار۵۵٫۳۵۴٫۷۵۷٫۹
GDPval-AA v2۱۷۷۳۱۵۰۴۱۵۸۲۱۵۷۱

نسبت به نسل قبل: جهش، آن هم با هزینه‌ی کمتر

در هر هشت ردیف از GLM-5.2 جلوتر است و در چند مورد فاصله بزرگ است: مهندسی نرم‌افزار عمیق از ۴۶٫۲ به ۶۳٫۴، خودکارسازی کارهای اداری از ۲۶٫۲ به ۴۸٫۸ و کار با ابزارها از ۵۹٫۹ به ۷۸٫۴. نکته اینجاست که این جهش هم‌زمان با کاهش قیمت آمده، نه در ازای آن — و این ترکیب، چیزی است که معمولاً بین دو نسل دیده نمی‌شود.

کنار پرچم‌داران: در کارهای عاملی جلو، در کدنویسی سنگین عقب

در سه ردیف بالاتر از هر دو پرچم‌دار بسته می‌ایستد: در GDPval — که کار را با معیار ارزش شغلی می‌سنجد — با ۱۷۷۳ بالاترین امتیاز کل جدول را دارد؛ در کار با ابزارها با ۷۸٫۴ و در خودکارسازی با ۴۸٫۸ هم اول است.

در مقابل، در کدنویسی سنگین عقب می‌ماند: در NL2Repo امتیاز ۵۶٫۳ در برابر ۶۹٫۷ و در کار خط فرمان ۸۴٫۳ در برابر ۸۷٫۴. پس این مدل صدرنشین مطلق نیست و ادعایش هم این نیست؛ ادعایش نسبتِ کیفیت به هزینه است.

تازه‌ترین توانایی: این مدل می‌بیند

مهم‌ترین تفاوت این نسخه با بقیه‌ی خانواده، بینایی است. و برخلاف انتظار، قوی‌ترین نتایجش در جایی نیست که عکس تفریحی تحلیل کند — در کار اداری است:

سنجه‌ی بیناییGLM-5.3 FlashClaude Opus 4.8Gemini 3.7 Flash
OfficeQA Pro — درک اسناد اداری۶۲٫۴۴۸٫۹
Chartography — خواندن نمودار۷۸٫۰۷۵٫۰۶۵٫۰
CharXiv — استدلال روی نمودار۸۹٫۴۸۹٫۹۸۸٫۷
MMVU — درک ویدیو۸۰٫۵۶۷٫۴۸۲٫۳
BabyVision — ادراک پایه۵۳٫۴۴۶٫۸۷۰٫۹

ردیف اول از همه گویاتر است: در درک اسناد اداری (فاکتور، گزارش، جدول‌های مالی) با اختلاف معناداری از پرچم‌دار بسته جلو می‌زند. در خواندن و استدلال روی نمودار هم در صدر یا هم‌ردهٔ صدر است. در مقابل، در ادراک بصری پایه و درک ویدیو از مدل تخصصی رقیب عقب‌تر است.

یعنی اگر کارتان «این گزارش را بخوان و خلاصه کن» یا «از این نمودار عدد دربیاور» است، این مدل انتخاب بسیار خوبی است؛ اگر کارتان تحلیل عمیق ویدیو است، جای دیگری را نگاه کنید.

«چندوجهی» یک برچسب بازاریابی شده است. پرسش درست این نیست که مدل تصویر را می‌پذیرد یا نه — تقریباً همه می‌پذیرند. پرسش این است که روی کدام نوع تصویر خوب است. همان‌طور که جدول بالا نشان می‌دهد، یک مدل می‌تواند در خواندن سند سرآمد باشد و در فهم ویدیو معمولی.

مقایسه‌ی هزینه: جایی که تفاوت از چند درصد به چند برابر می‌رسد

برای اینکه مقایسه معنادار باشد، به‌جای عدد مطلق از شاخص نسبی استفاده می‌کنیم: هزینه‌ی GLM-5.3 Flash را برابر ۱ می‌گیریم و بقیه را نسبت به آن می‌سنجیم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی)، چون در عمل معمولاً خیلی بیشتر از آنکه بخوانید، متن می‌فرستید.

مدلشاخص ورودیشاخص خروجیشاخص گفت‌وگوی معمول
GLM-5.3 Flash۱٫۰۱٫۰۱٫۰۰
DeepSeek V4 Flash۰٫۵۹۰٫۳۵۰٫۵۰
Gemini 3.7 Flash۵٫۰۷٫۵۶٫۰۰
GLM-5.2 (نسل قبل)۱٫۹۱٫۸۱٫۸۲
Claude Haiku 4.5۶٫۷۱۰٫۰۸٫۰۰
GLM-5.3۹٫۳۸٫۸۹٫۱۲
Claude Opus 4.8۳۳٫۳۵۰٫۰۴۰٫۰۰

این جدول را با جدول بنچمارک کنار هم بگذارید، چون تنها با هم معنا می‌دهند. فاصله‌ی امتیازها در بیشتر ردیف‌ها یک‌رقمی بود؛ فاصله‌ی هزینه‌ها ده‌ها برابر است. گران‌ترین گزینه‌ی این فهرست برای همان گفت‌وگو حدود چهل برابر خرج برمی‌دارد.

دو نکته برای انصاف: اول اینکه نسبت به نسل قبلی خودش هم حدود دو برابر ارزان‌تر است، پس اگر روی GLM-5.2 چیزی ساخته‌اید، این تقریباً همیشه ارتقای درستی است. دوم اینکه ارزان‌ترین گزینه‌ی جدول این مدل نیست — چند مدل سبکِ دیگر هم‌رده یا کمی ارزان‌ترند و اگر کارتان واقعاً ساده است باید آن‌ها را هم بسنجید. یک تذکر لازم هم اینکه این جدول عکسِ لحظه‌ای تعرفه‌هاست و تعرفه‌ها تغییر می‌کنند؛ ارقام این جدول در ۱۹ شهریور ۱۴۰۵ بازبینی شده‌اند؛ مرجع همیشگی، عدد به‌روزِ هر مدل در کاتالوگ مدل‌هاست.

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

  • سراغ GLM-5.3 Flash بروید وقتی حجم درخواستتان بالاست و هزینه تعیین‌کننده است، کار عاملی و چندمرحله‌ای دارید، با اسناد و نمودار سروکار دارید، یا متن ورودی‌تان بلند است. برای بیشتر کارهای روزمره، این گزینه‌ی پیش‌فرضِ سنجیده‌ای است.
  • سراغ GLM-5.3 یا یک پرچم‌دار بسته بروید وقتی مسئله‌ی مهندسی نرم‌افزارِ سنگین و چندفایلی در کار است — همان دو ردیفی که جدول بالا صریحاً نشان می‌دهد عقب است — و کیفیت آن‌قدر حیاتی است که چند برابر هزینه توجیه دارد.
  • سراغ یک مدل تخصصی بروید برای تحلیل عمیق ویدیو، که تنها دسته‌ای است که این مدل در آن به‌روشنی دنبال‌رو است.

لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدل‌ها همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید؛ این مطمئن‌ترین راه است، چون هیچ بنچمارکی جای کار واقعی شما را نمی‌گیرد.

پرسش‌های متداول

آیا GLM-5.3 Flash از GLM-5.3 بهتر است؟

نه — ارزان‌تر است، نه بهتر. در کارهای عاملی و اسناد نتایج نزدیک یا بهتری می‌گیرد، ولی در کدنویسی سنگین GLM-5.3 جلوتر است. تفاوت واقعی در قیمت است: Flash حدود یک‌نهمِ آن هزینه دارد. برای بیشتر کارها این معامله‌ی خوبی است، برای کدنویسی پیچیده لزوماً نه.

«۳۲۰ میلیارد پارامتر ولی ۱۸ میلیارد فعال» یعنی چه؟

یعنی مدل دانش یک شبکه‌ی بسیار بزرگ را دارد، اما برای هر پاسخ فقط بخش کوچکی از آن روشن می‌شود. هزینه و سرعت را همان بخش کوچک تعیین می‌کند — به همین دلیل مدلی به این بزرگی می‌تواند قیمتی در رده‌ی مدل‌های سبک داشته باشد.

تصویر را واقعاً می‌فهمد یا فقط قبول می‌کند؟

واقعاً می‌فهمد، ولی نه در همه‌ی زمینه‌ها یکسان. در خواندن سند و نمودار جزو بهترین‌هاست و حتی از پرچم‌داران بسته جلو می‌زند؛ در ادراک بصری پایه و ویدیو متوسط است. جدول بینایی در همین مقاله تفکیکش را نشان می‌دهد.

فارسی را خوب می‌فهمد؟

این خانواده در سنجه‌های چندزبانه امتیاز خوبی دارد، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید و در صورت نیاز تصویر را هم به گفت‌وگو اضافه کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

GLM-5.3 Flash بهترین مدل جهان نیست و چنین ادعایی هم ندارد. چیزی که هست جالب‌تر است: مدلی که در کارهای عاملی و درک اسناد از پرچم‌داران گران‌تر جلو می‌زند، در کدنویسی سنگین پشت سرشان می‌ماند، تصویر را از پایه می‌فهمد، و همه‌ی این‌ها را با کسری از هزینه انجام می‌دهد. برای بخش بزرگی از کار واقعی، این دقیقاً همان نقطه‌ای است که باید از آن شروع کرد.

ساده‌ترین راه قضاوت، امتحان‌کردن با کار خودتان است. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد و می‌توانید همین امروز مقایسه را خودتان انجام دهید.

مطالب دیگر