GLM-5.3: بررسی کامل، بنچمارک‌ها و مقایسه‌ی هزینه با مدل‌های پرچم‌دار

خانواده‌ی GLM نسخه‌ی تازه‌اش را منتشر کرد: GLM-5.3، یک مدل زبانی بزرگ با حافظه‌ی گفت‌وگوی یک‌میلیون‌توکنی که از همان روز نخست در هوشواره در دسترس است. نکته‌ی غیرعادی این انتشار اینجاست که مدل پایه اصلاً عوض نشده — این همان مدلِ نسل قبل است و فقط مرحله‌ی دوم آموزشش بسیار گسترده‌تر شده؛ با این حال در یکی از سنجه‌ها امتیازش بیش از شش برابر شده است. در این مقاله سه پرسش را جدا از هم جواب می‌دهیم: چه چیزی واقعاً عوض شده، در سنجه‌های منتشرشده کجا ایستاده، و — پرسشی که معمولاً از قلم می‌افتد — هزینه‌اش کنار بقیه‌ی پرچم‌داران چقدر است.

GLM-5.3 دقیقاً چیست؟

GLM خانواده‌ی مدل‌های زبانی شرکت Z.ai است و نسخه‌ی ۵٫۳ یک به‌روزرسانی روی نسل ۵٫۲ به‌حساب می‌آید، نه یک معماری تازه. مشخصات کلیدی:

  • پنجره‌ی متن یک میلیون توکن — چیزی در حدود هفتصد و پنجاه هزار کلمه که یک‌جا جلوی مدل می‌گذارید.
  • همان مدل پایه‌ی نسل قبل؛ تمام تفاوت از مرحله‌ی دوم آموزش می‌آید، نه از آموزش اولیه.
  • سه سطح عمق استدلال: سبک، بالا و بیشینه. برخلاف نسل قبل، خاموش‌کردن کامل استدلال دیگر ممکن نیست و کم‌ترین حالت «سبک» است. سازنده برای کدنویسی، بیشینه را توصیه می‌کند.
  • فراخوانی ابزار و کار در محیط کدنویسی — یعنی برای کارهای عاملی ساخته شده، نه فقط پرسش‌وپاسخ.
  • سازنده اعلام کرده وزن‌های مدل را دو هفته پس از انتشار و بعد از تکمیل ارزیابی‌های ایمنی منتشر می‌کند.

«پس‌آموزش» یعنی چه، و چرا این‌بار مهم است؟

ساخت یک مدل زبانی دو مرحله دارد. در مرحله‌ی اول، مدل پایه روی حجم عظیمی از متن آموزش می‌بیند؛ این گران‌ترین و کندترین بخش کار است و همان چیزی است که «اندازه»ی مدل را می‌سازد. در مرحله‌ی دوم — که به آن پس‌آموزش می‌گویند — همان مدلِ آماده با تمرین روی کارهای مشخص و گرفتن بازخورد از نتیجه پخته می‌شود؛ روشی که پایه‌اش یادگیری تقویتی است.

GLM-5.3 فقط مرحله‌ی دوم را عوض کرده است. تمرکز اعلام‌شده‌ی سازنده روی ساختن «محیط‌های تمرینی» بوده: کارهایی که به‌جای تمرین‌های کوچک برنامه‌نویسی، شبیه یک واحد کار واقعی‌اند — گاهی چند روز کارِ یک مهندس باتجربه. در نمونه‌ای که خودشان توصیف کرده‌اند، مدل همان محیط کاری یک مهندس را در اختیار می‌گیرد: باید گلوگاه را تشخیص بدهد، بهینه‌سازی را پیاده کند، آزمایش بگیرد و در پایان یک بهبود قابل اندازه‌گیری تحویل بدهد، بی‌آنکه چیزی خراب شود.

تفاوت این با تمرین‌های معمول در همین است: مدل یاد می‌گیرد کار را تا انتها تحویل بدهد، به‌جای اینکه منتظر بماند کاربر مسئله را خرد کند و قدم‌به‌قدم راهنمایی‌اش کند.

مدل پایه استعداد است؛ پس‌آموزش تمرین. این نسخه نشان می‌دهد وقتی تمرین به‌اندازه‌ی کافی شبیه کار واقعی باشد، بدون یک ذره استعدادِ بیشتر هم می‌شود جهش گرفت.

— تیم هوشواره

کارنامه‌ی بنچمارک‌ها: کجا جلو، کجا عقب

جدول زیر سنجه‌هایی است که در معرفی رسمی منتشر شد. عددهای بزرگ‌تر بهترند و ستون سوم، نسل قبلی همین خانواده است.

سنجهGLM-5.3GLM-5.2Claude Fable 5GPT-5.6 Sol
Terminal-Bench 2.1۸۸٫۲۸۱٫۰۸۸٫۰۸۸٫۸
Terminal-Bench 3.0۲۸٫۳۴٫۶۳۳٫۷۳۴٫۶
DeepSWE v1.1۶۶٫۹۴۶٫۲۶۹٫۷۷۲٫۷
FrontierSWE۷۸٫۱۶۷٫۵۸۸٫۲
SWE-Marathon v1.1۴۲٫۵۱۹٫۴۳۳٫۱۴۲٫۵
ProgramBench۱۹٫۰۹٫۵۳۳٫۰۲۳٫۰
Toolathlon Verified۷۳٫۰۵۹٫۹۷۴٫۷۷۴٫۹
AutomationBench۴۸٫۲۲۶٫۲۴۶٫۲۴۵٫۸
Agents' Last Exam۲۸٫۵۲۳٫۸۲۳٫۸۲۸٫۶
HLE با ابزار۶۲٫۵۵۴٫۷۶۳٫۹۶۴٫۵
GDPval-AA v2۱۷۶۹۱۵۰۸۱۷۴۳۱۷۳۰

نسبت به نسل قبل: جهش، نه وصله

روشن‌ترین خواندنِ این جدول، ستون دوم در برابر ستون سوم است. در هر یازده ردیف پیشرفت هست و در چند مورد فاصله غیرعادی است: کار در خط فرمان (نسخه‌ی ۳٫۰) از ۴٫۶ به ۲۸٫۳، ماراتن رفع باگ از ۱۹٫۴ به ۴۲٫۵، خودکارسازی کارهای اداری از ۲۶٫۲ به ۴۸٫۲ و مهندسی نرم‌افزار عمیق از ۴۶٫۲ به ۶۶٫۹ رسیده. برای نسخه‌ای که حتی مدل پایه‌اش عوض نشده، این شیب چیز کمی نیست.

کنار پرچم‌داران رقیب: تصویر یکدست نیست

در برابر رقبا داستان دو رو دارد و بهتر است هر دو رو را ببینید. این مدل در سه ردیف از پرچم‌داران بسته جلو می‌زند: در GDPval — که کار را با معیار ارزشِ شغلی می‌سنجد — با ۱۷۶۹ بالاترین امتیاز کل جدول را دارد؛ در خودکارسازی کارهای اداری با ۴۸٫۲ باز هم اول است؛ و در ماراتن رفع باگ با ۴۲٫۵ از یکی از دو رقیب جلو می‌افتد و با دیگری برابر می‌شود.

در مقابل، در کدنویسیِ سنگین عقب می‌ماند: در Terminal-Bench 3.0 امتیاز ۲۸٫۳ در برابر ۳۳٫۷ و ۳۴٫۶، در DeepSWE امتیاز ۶۶٫۹ در برابر ۶۹٫۷ و ۷۲٫۷، و در ProgramBench با ۱۹٫۰ به‌روشنی پایین‌تر از هر دو. پس این مدل صدرنشین مطلق نیست و ادعایش هم این نیست؛ ادعایش این است که در میان مدل‌هایی که وزن‌هایشان منتشر می‌شود، بهترین گزینه برای کدنویسی است.

توکن کمتر برای همان کار — بخشی که مستقیم به جیب شما مربوط است

یک عدد در این معرفی هست که معمولاً کسی جدی‌اش نمی‌گیرد، در حالی که در عمل بیش از رتبه‌ی بنچمارک به کار شما می‌آید: مصرف توکن. چون صورت‌حساب شما بر پایه‌ی توکن است، مدلی که همان کار را با توکن کمتری تمام کند عملاً ارزان‌تر است، حتی اگر تعرفه‌ی هر توکنش یکسان باشد.

سازنده روی سنجه‌ی داخلی خودش گزارش می‌کند که در بالاترین سطح استدلال، GLM-5.3 نرخ اتمام کار را از ۲۳٫۴ به ۳۴٫۵ درصد رسانده و هم‌زمان مصرف توکن خروجی را از حدود ۹۶ هزار به حدود ۷۵ هزار توکن در هر کار پایین آورده — یعنی نتیجه‌ی بهتر با حدود یک‌پنجم توکن کمتر. در سطح استدلالِ «بالا» هم با حدود ۵۰ هزار توکن به ۳۱٫۴ درصد می‌رسد، در حالی که یکی از پرچم‌داران بسته برای رسیدن به ۲۹٫۵ درصد حدود ۱۲۰ هزار توکن خرج می‌کند.

یک تذکر لازم: این سنجه، سنجه‌ی داخلیِ خودِ سازنده است و مثل هر عدد خودگزارش‌شده‌ای باید محتاطانه خوانده شود. اما جهتش با سنجه‌های عمومی هم‌خوان است و دست‌کم به‌عنوان فرضیه‌ای قابل آزمودن ارزش دارد — آزمودنش هم ساده است: همان کار واقعی خودتان را بدهید و هزینه‌ی نهایی را ببینید.

دو مدل با تعرفه‌ی برابر می‌توانند صورت‌حساب‌های خیلی متفاوتی بسازند. آنچه می‌پردازید حاصل‌ضرب تعرفه در تعداد توکن است، و مدلی که پُرحرف‌تر فکر می‌کند گران‌تر تمام می‌شود، حتی وقتی روی کاغذ ارزان‌تر است.

یک توانایی غیرمنتظره: پیدا کردن آسیب‌پذیری

سازنده می‌گوید در جریان همین پس‌آموزش، داده و محیط مربوط به کشف آسیب‌پذیری‌های نرم‌افزاری را هم وارد تمرین کرده و نتیجه سریع‌تر از انتظارش رشد کرده است. در سنجه‌ی CyberGym — که کار مدل، شناسایی و تأیید یک نقص امنیتی در کد است — امتیاز ۸۴٫۵ گرفته و بالاتر از هر دو پرچم‌دار بسته‌ی جدول ایستاده.

بخش عملی‌تر ماجرا این است که این توانایی از محیط آزمون بیرون هم آمده: سازنده گزارش می‌دهد با همکاری چند تیم امنیتی و پس از بازبینی کارشناسی، مدل ۲۴۳۶ آسیب‌پذیری را در ۲۶۹ پروژه‌ی متن‌باز پیدا کرده که ۱۰۹۷ موردشان شدت متوسط تا بالا داشته‌اند؛ بعضی از این نقص‌ها دهه‌ها در کد مانده بودند. یافته‌ها در یک دفترچه‌ی عمومی ثبت می‌شوند تا روند اصلاحشان قابل پیگیری باشد.

اینکه این توانایی چقدر عمیق است بحث جداگانه‌ای دارد که در تحلیل تفصیلی همین جدول سراغش رفته‌ایم؛ خلاصه‌اش این است که مدل در «تشخیص» به‌مراتب جلوتر از «بهره‌برداری» است.

مقایسه‌ی هزینه: جایی که تفاوت واقعاً دیده می‌شود

برای اینکه مقایسه معنادار باشد، به‌جای عدد مطلق از شاخص نسبی استفاده می‌کنیم: هزینه‌ی GLM-5.3 را برابر ۱ می‌گیریم و بقیه را نسبت به آن می‌سنجیم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی)، چون در عمل معمولاً خیلی بیشتر از آنکه بخوانید، متن می‌فرستید.

مدلشاخص ورودیشاخص خروجیشاخص گفت‌وگوی معمول
GLM-5.3۱٫۰۱٫۰۱٫۰۰
GLM-5.2 (نسل قبل)۰٫۲۰۰٫۲۰۰٫۲۰
DeepSeek V4 Pro۰٫۶۸۰٫۴۳۰٫۵۹
Qwen 3.8 Max۱٫۴۳۱٫۳۶۱٫۴۰
Claude Sonnet 5۱٫۴۳۲٫۲۷۱٫۷۵
GPT-5.6 Sol۱٫۴۳۲٫۲۷۱٫۷۵
Claude Opus 4.8۳٫۵۷۵٫۶۸۴٫۳۹
Claude Fable 5۷٫۱۴۱۱٫۳۶۸٫۷۷

دو چیز در این جدول هست که باید کنار هم دیده شوند. اول: در برابر پرچم‌داران بسته فاصله چندبرابری است — گران‌ترین گزینه‌ی فهرست برای همان گفت‌وگو نزدیک به نُه برابر خرج برمی‌دارد، در حالی که فاصله‌ی امتیازهایش در جدول بنچمارک در بیشتر ردیف‌ها یک‌رقمی بود.

دوم — و این همان چیزی است که معرفی‌های رسمی نمی‌گویند: این نسخه از نسل قبلیِ خودش گران‌تر است، حدود پنج برابر. اگر کارتان ساده است و نسل قبل جوابتان را می‌داد، ارتقا لزوماً به سودتان نیست. جایی که ارتقا می‌ارزد کارهای چندمرحله‌ای و کدنویسی است؛ همان‌جا که هم امتیازها جهش کرده‌اند و هم مصرف توکن پایین آمده و بخشی از این گرانی را پس می‌دهد. یک تذکر لازم هم اینکه این جدول عکسِ لحظه‌ای تعرفه‌هاست و تعرفه‌ها تغییر می‌کنند؛ ارقام این جدول در ۱۹ شهریور ۱۴۰۵ بازبینی شده‌اند؛ مرجع همیشگی، عدد به‌روزِ هر مدل در کاتالوگ مدل‌هاست.

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

  • سراغ GLM-5.3 بروید وقتی کار چندمرحله‌ای و عاملی دارید، کدنویسی و رفع باگ در یک پروژه‌ی واقعی در کار است، متن ورودی‌تان بلند است، یا حجم درخواستتان بالاست و هزینه برایتان تعیین‌کننده است.
  • سراغ پرچم‌دار بسته بروید وقتی مسئله دقیقاً از جنس همان دو سه سنجه‌ای است که این مدل در آن‌ها عقب ماند — کدنویسی بسیار سنگین و طولانی در خط فرمان — و کیفیت آن‌قدر حیاتی است که چند برابر هزینه توجیه دارد.
  • سراغ نسل قبل یا یک مدل سبک بروید برای ترجمه‌ی کوتاه، خلاصه، دسته‌بندی و پاسخ‌های روزمره. صرفه‌جویی واقعی از انتخاب رده‌ی درست می‌آید، نه از چسبیدن به تازه‌ترین مدل ممکن.

لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدل‌ها همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.

پرسش‌های متداول

آیا GLM-5.3 از GPT و Claude بهتر است؟

نه به‌طور مطلق. در سنجه‌ی ارزش شغلی، خودکارسازی کارهای اداری و کشف آسیب‌پذیری جلوتر است؛ در کدنویسی سنگین و طولانی عقب‌تر. تفاوت اصلی‌اش کیفیت نیست، نسبت کیفیت به هزینه است.

تفاوتش با GLM-5.2 چقدر است؟

در همه‌ی سنجه‌های منتشرشده بالاتر است و در کارهای عاملی و کدنویسی فاصله بزرگ است. در عوض تعرفه‌اش هم حدود پنج برابر شده، پس اگر کارتان سبک است نسل قبل هنوز انتخاب سنجیده‌ای است؛ هر دو در کاتالوگ مدل‌ها در دسترس‌اند.

«مدل پایه عوض نشده» یعنی مدل قوی‌تر نشده؟

یعنی ظرفیت خامش همان است و آنچه بهتر شده، استفاده‌ی مؤثر از همان ظرفیت است. برای شما که خروجی را می‌بینید نتیجه در بیشتر کارها واقعاً بهتر است؛ اما همین نکته توضیح می‌دهد چرا پیشرفت در بعضی سنجه‌ها بزرگ و در بعضی کوچک بوده. تفصیلش را در تحلیل جداگانه آورده‌ایم.

پنجره‌ی یک میلیون توکن یعنی چه؟

یعنی مدل می‌تواند در یک گفت‌وگو حدود هفتصد و پنجاه هزار کلمه را هم‌زمان «در ذهن» داشته باشد — چیزی در حد چند جلد کتاب. برای مرور یک پروژه‌ی کامل یا تحلیل اسناد بلند، این تعیین‌کننده است.

فارسی را خوب می‌فهمد؟

این خانواده در سنجه‌های چندزبانه امتیاز خوبی دارد، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

GLM-5.3 بهترین مدل جهان نیست و خودش هم چنین ادعایی ندارد. چیزی که هست جالب‌تر است: نسخه‌ای که بدون عوض‌کردن مدل پایه، در کارهای چندمرحله‌ای و کدنویسی جهش کرده، در سه سنجه بالاتر از پرچم‌داران بسته ایستاده، همان کار را با توکن کمتری تمام می‌کند و این را با کسری از هزینه‌ی آن‌ها انجام می‌دهد — به شرط آنکه حواستان باشد نسبت به نسل قبلِ خودش گران‌تر شده است.

ساده‌ترین راه قضاوت، امتحان‌کردن با کار خودتان است. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد و می‌توانید همین امروز مقایسه را خودتان انجام دهید.

مطالب دیگر