GLM-5.3: بررسی کامل، بنچمارکها و مقایسهی هزینه با مدلهای پرچمدار
خانوادهی GLM نسخهی تازهاش را منتشر کرد: GLM-5.3، یک مدل زبانی بزرگ با حافظهی گفتوگوی یکمیلیونتوکنی که از همان روز نخست در هوشواره در دسترس است. نکتهی غیرعادی این انتشار اینجاست که مدل پایه اصلاً عوض نشده — این همان مدلِ نسل قبل است و فقط مرحلهی دوم آموزشش بسیار گستردهتر شده؛ با این حال در یکی از سنجهها امتیازش بیش از شش برابر شده است. در این مقاله سه پرسش را جدا از هم جواب میدهیم: چه چیزی واقعاً عوض شده، در سنجههای منتشرشده کجا ایستاده، و — پرسشی که معمولاً از قلم میافتد — هزینهاش کنار بقیهی پرچمداران چقدر است.
GLM-5.3 دقیقاً چیست؟
GLM خانوادهی مدلهای زبانی شرکت Z.ai است و نسخهی ۵٫۳ یک بهروزرسانی روی نسل ۵٫۲ بهحساب میآید، نه یک معماری تازه. مشخصات کلیدی:
- پنجرهی متن یک میلیون توکن — چیزی در حدود هفتصد و پنجاه هزار کلمه که یکجا جلوی مدل میگذارید.
- همان مدل پایهی نسل قبل؛ تمام تفاوت از مرحلهی دوم آموزش میآید، نه از آموزش اولیه.
- سه سطح عمق استدلال: سبک، بالا و بیشینه. برخلاف نسل قبل، خاموشکردن کامل استدلال دیگر ممکن نیست و کمترین حالت «سبک» است. سازنده برای کدنویسی، بیشینه را توصیه میکند.
- فراخوانی ابزار و کار در محیط کدنویسی — یعنی برای کارهای عاملی ساخته شده، نه فقط پرسشوپاسخ.
- سازنده اعلام کرده وزنهای مدل را دو هفته پس از انتشار و بعد از تکمیل ارزیابیهای ایمنی منتشر میکند.
«پسآموزش» یعنی چه، و چرا اینبار مهم است؟
ساخت یک مدل زبانی دو مرحله دارد. در مرحلهی اول، مدل پایه روی حجم عظیمی از متن آموزش میبیند؛ این گرانترین و کندترین بخش کار است و همان چیزی است که «اندازه»ی مدل را میسازد. در مرحلهی دوم — که به آن پسآموزش میگویند — همان مدلِ آماده با تمرین روی کارهای مشخص و گرفتن بازخورد از نتیجه پخته میشود؛ روشی که پایهاش یادگیری تقویتی است.
GLM-5.3 فقط مرحلهی دوم را عوض کرده است. تمرکز اعلامشدهی سازنده روی ساختن «محیطهای تمرینی» بوده: کارهایی که بهجای تمرینهای کوچک برنامهنویسی، شبیه یک واحد کار واقعیاند — گاهی چند روز کارِ یک مهندس باتجربه. در نمونهای که خودشان توصیف کردهاند، مدل همان محیط کاری یک مهندس را در اختیار میگیرد: باید گلوگاه را تشخیص بدهد، بهینهسازی را پیاده کند، آزمایش بگیرد و در پایان یک بهبود قابل اندازهگیری تحویل بدهد، بیآنکه چیزی خراب شود.
تفاوت این با تمرینهای معمول در همین است: مدل یاد میگیرد کار را تا انتها تحویل بدهد، بهجای اینکه منتظر بماند کاربر مسئله را خرد کند و قدمبهقدم راهنماییاش کند.
مدل پایه استعداد است؛ پسآموزش تمرین. این نسخه نشان میدهد وقتی تمرین بهاندازهی کافی شبیه کار واقعی باشد، بدون یک ذره استعدادِ بیشتر هم میشود جهش گرفت.
— تیم هوشواره
کارنامهی بنچمارکها: کجا جلو، کجا عقب
جدول زیر سنجههایی است که در معرفی رسمی منتشر شد. عددهای بزرگتر بهترند و ستون سوم، نسل قبلی همین خانواده است.
| سنجه | GLM-5.3 | GLM-5.2 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 2.1 | ۸۸٫۲ | ۸۱٫۰ | ۸۸٫۰ | ۸۸٫۸ |
| Terminal-Bench 3.0 | ۲۸٫۳ | ۴٫۶ | ۳۳٫۷ | ۳۴٫۶ |
| DeepSWE v1.1 | ۶۶٫۹ | ۴۶٫۲ | ۶۹٫۷ | ۷۲٫۷ |
| FrontierSWE | ۷۸٫۱ | ۶۷٫۵ | ۸۸٫۲ | — |
| SWE-Marathon v1.1 | ۴۲٫۵ | ۱۹٫۴ | ۳۳٫۱ | ۴۲٫۵ |
| ProgramBench | ۱۹٫۰ | ۹٫۵ | ۳۳٫۰ | ۲۳٫۰ |
| Toolathlon Verified | ۷۳٫۰ | ۵۹٫۹ | ۷۴٫۷ | ۷۴٫۹ |
| AutomationBench | ۴۸٫۲ | ۲۶٫۲ | ۴۶٫۲ | ۴۵٫۸ |
| Agents' Last Exam | ۲۸٫۵ | ۲۳٫۸ | ۲۳٫۸ | ۲۸٫۶ |
| HLE با ابزار | ۶۲٫۵ | ۵۴٫۷ | ۶۳٫۹ | ۶۴٫۵ |
| GDPval-AA v2 | ۱۷۶۹ | ۱۵۰۸ | ۱۷۴۳ | ۱۷۳۰ |
نسبت به نسل قبل: جهش، نه وصله
روشنترین خواندنِ این جدول، ستون دوم در برابر ستون سوم است. در هر یازده ردیف پیشرفت هست و در چند مورد فاصله غیرعادی است: کار در خط فرمان (نسخهی ۳٫۰) از ۴٫۶ به ۲۸٫۳، ماراتن رفع باگ از ۱۹٫۴ به ۴۲٫۵، خودکارسازی کارهای اداری از ۲۶٫۲ به ۴۸٫۲ و مهندسی نرمافزار عمیق از ۴۶٫۲ به ۶۶٫۹ رسیده. برای نسخهای که حتی مدل پایهاش عوض نشده، این شیب چیز کمی نیست.
کنار پرچمداران رقیب: تصویر یکدست نیست
در برابر رقبا داستان دو رو دارد و بهتر است هر دو رو را ببینید. این مدل در سه ردیف از پرچمداران بسته جلو میزند: در GDPval — که کار را با معیار ارزشِ شغلی میسنجد — با ۱۷۶۹ بالاترین امتیاز کل جدول را دارد؛ در خودکارسازی کارهای اداری با ۴۸٫۲ باز هم اول است؛ و در ماراتن رفع باگ با ۴۲٫۵ از یکی از دو رقیب جلو میافتد و با دیگری برابر میشود.
در مقابل، در کدنویسیِ سنگین عقب میماند: در Terminal-Bench 3.0 امتیاز ۲۸٫۳ در برابر ۳۳٫۷ و ۳۴٫۶، در DeepSWE امتیاز ۶۶٫۹ در برابر ۶۹٫۷ و ۷۲٫۷، و در ProgramBench با ۱۹٫۰ بهروشنی پایینتر از هر دو. پس این مدل صدرنشین مطلق نیست و ادعایش هم این نیست؛ ادعایش این است که در میان مدلهایی که وزنهایشان منتشر میشود، بهترین گزینه برای کدنویسی است.
توکن کمتر برای همان کار — بخشی که مستقیم به جیب شما مربوط است
یک عدد در این معرفی هست که معمولاً کسی جدیاش نمیگیرد، در حالی که در عمل بیش از رتبهی بنچمارک به کار شما میآید: مصرف توکن. چون صورتحساب شما بر پایهی توکن است، مدلی که همان کار را با توکن کمتری تمام کند عملاً ارزانتر است، حتی اگر تعرفهی هر توکنش یکسان باشد.
سازنده روی سنجهی داخلی خودش گزارش میکند که در بالاترین سطح استدلال، GLM-5.3 نرخ اتمام کار را از ۲۳٫۴ به ۳۴٫۵ درصد رسانده و همزمان مصرف توکن خروجی را از حدود ۹۶ هزار به حدود ۷۵ هزار توکن در هر کار پایین آورده — یعنی نتیجهی بهتر با حدود یکپنجم توکن کمتر. در سطح استدلالِ «بالا» هم با حدود ۵۰ هزار توکن به ۳۱٫۴ درصد میرسد، در حالی که یکی از پرچمداران بسته برای رسیدن به ۲۹٫۵ درصد حدود ۱۲۰ هزار توکن خرج میکند.
یک تذکر لازم: این سنجه، سنجهی داخلیِ خودِ سازنده است و مثل هر عدد خودگزارششدهای باید محتاطانه خوانده شود. اما جهتش با سنجههای عمومی همخوان است و دستکم بهعنوان فرضیهای قابل آزمودن ارزش دارد — آزمودنش هم ساده است: همان کار واقعی خودتان را بدهید و هزینهی نهایی را ببینید.
دو مدل با تعرفهی برابر میتوانند صورتحسابهای خیلی متفاوتی بسازند. آنچه میپردازید حاصلضرب تعرفه در تعداد توکن است، و مدلی که پُرحرفتر فکر میکند گرانتر تمام میشود، حتی وقتی روی کاغذ ارزانتر است.
یک توانایی غیرمنتظره: پیدا کردن آسیبپذیری
سازنده میگوید در جریان همین پسآموزش، داده و محیط مربوط به کشف آسیبپذیریهای نرمافزاری را هم وارد تمرین کرده و نتیجه سریعتر از انتظارش رشد کرده است. در سنجهی CyberGym — که کار مدل، شناسایی و تأیید یک نقص امنیتی در کد است — امتیاز ۸۴٫۵ گرفته و بالاتر از هر دو پرچمدار بستهی جدول ایستاده.
بخش عملیتر ماجرا این است که این توانایی از محیط آزمون بیرون هم آمده: سازنده گزارش میدهد با همکاری چند تیم امنیتی و پس از بازبینی کارشناسی، مدل ۲۴۳۶ آسیبپذیری را در ۲۶۹ پروژهی متنباز پیدا کرده که ۱۰۹۷ موردشان شدت متوسط تا بالا داشتهاند؛ بعضی از این نقصها دههها در کد مانده بودند. یافتهها در یک دفترچهی عمومی ثبت میشوند تا روند اصلاحشان قابل پیگیری باشد.
اینکه این توانایی چقدر عمیق است بحث جداگانهای دارد که در تحلیل تفصیلی همین جدول سراغش رفتهایم؛ خلاصهاش این است که مدل در «تشخیص» بهمراتب جلوتر از «بهرهبرداری» است.
مقایسهی هزینه: جایی که تفاوت واقعاً دیده میشود
برای اینکه مقایسه معنادار باشد، بهجای عدد مطلق از شاخص نسبی استفاده میکنیم: هزینهی GLM-5.3 را برابر ۱ میگیریم و بقیه را نسبت به آن میسنجیم. ستون آخر یک ترکیب واقعگرایانه از گفتوگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی)، چون در عمل معمولاً خیلی بیشتر از آنکه بخوانید، متن میفرستید.
| مدل | شاخص ورودی | شاخص خروجی | شاخص گفتوگوی معمول |
|---|---|---|---|
| GLM-5.3 | ۱٫۰ | ۱٫۰ | ۱٫۰۰ |
| GLM-5.2 (نسل قبل) | ۰٫۲۰ | ۰٫۲۰ | ۰٫۲۰ |
| DeepSeek V4 Pro | ۰٫۶۸ | ۰٫۴۳ | ۰٫۵۹ |
| Qwen 3.8 Max | ۱٫۴۳ | ۱٫۳۶ | ۱٫۴۰ |
| Claude Sonnet 5 | ۱٫۴۳ | ۲٫۲۷ | ۱٫۷۵ |
| GPT-5.6 Sol | ۱٫۴۳ | ۲٫۲۷ | ۱٫۷۵ |
| Claude Opus 4.8 | ۳٫۵۷ | ۵٫۶۸ | ۴٫۳۹ |
| Claude Fable 5 | ۷٫۱۴ | ۱۱٫۳۶ | ۸٫۷۷ |
دو چیز در این جدول هست که باید کنار هم دیده شوند. اول: در برابر پرچمداران بسته فاصله چندبرابری است — گرانترین گزینهی فهرست برای همان گفتوگو نزدیک به نُه برابر خرج برمیدارد، در حالی که فاصلهی امتیازهایش در جدول بنچمارک در بیشتر ردیفها یکرقمی بود.
دوم — و این همان چیزی است که معرفیهای رسمی نمیگویند: این نسخه از نسل قبلیِ خودش گرانتر است، حدود پنج برابر. اگر کارتان ساده است و نسل قبل جوابتان را میداد، ارتقا لزوماً به سودتان نیست. جایی که ارتقا میارزد کارهای چندمرحلهای و کدنویسی است؛ همانجا که هم امتیازها جهش کردهاند و هم مصرف توکن پایین آمده و بخشی از این گرانی را پس میدهد. یک تذکر لازم هم اینکه این جدول عکسِ لحظهای تعرفههاست و تعرفهها تغییر میکنند؛ ارقام این جدول در ۱۹ شهریور ۱۴۰۵ بازبینی شدهاند؛ مرجع همیشگی، عدد بهروزِ هر مدل در کاتالوگ مدلهاست.
پس چهوقت این مدل، چهوقت مدل دیگر؟
- سراغ GLM-5.3 بروید وقتی کار چندمرحلهای و عاملی دارید، کدنویسی و رفع باگ در یک پروژهی واقعی در کار است، متن ورودیتان بلند است، یا حجم درخواستتان بالاست و هزینه برایتان تعیینکننده است.
- سراغ پرچمدار بسته بروید وقتی مسئله دقیقاً از جنس همان دو سه سنجهای است که این مدل در آنها عقب ماند — کدنویسی بسیار سنگین و طولانی در خط فرمان — و کیفیت آنقدر حیاتی است که چند برابر هزینه توجیه دارد.
- سراغ نسل قبل یا یک مدل سبک بروید برای ترجمهی کوتاه، خلاصه، دستهبندی و پاسخهای روزمره. صرفهجویی واقعی از انتخاب ردهی درست میآید، نه از چسبیدن به تازهترین مدل ممکن.
لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدلها همان درخواست واقعی خودتان را همزمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.
پرسشهای متداول
آیا GLM-5.3 از GPT و Claude بهتر است؟
نه بهطور مطلق. در سنجهی ارزش شغلی، خودکارسازی کارهای اداری و کشف آسیبپذیری جلوتر است؛ در کدنویسی سنگین و طولانی عقبتر. تفاوت اصلیاش کیفیت نیست، نسبت کیفیت به هزینه است.
تفاوتش با GLM-5.2 چقدر است؟
در همهی سنجههای منتشرشده بالاتر است و در کارهای عاملی و کدنویسی فاصله بزرگ است. در عوض تعرفهاش هم حدود پنج برابر شده، پس اگر کارتان سبک است نسل قبل هنوز انتخاب سنجیدهای است؛ هر دو در کاتالوگ مدلها در دسترساند.
«مدل پایه عوض نشده» یعنی مدل قویتر نشده؟
یعنی ظرفیت خامش همان است و آنچه بهتر شده، استفادهی مؤثر از همان ظرفیت است. برای شما که خروجی را میبینید نتیجه در بیشتر کارها واقعاً بهتر است؛ اما همین نکته توضیح میدهد چرا پیشرفت در بعضی سنجهها بزرگ و در بعضی کوچک بوده. تفصیلش را در تحلیل جداگانه آوردهایم.
پنجرهی یک میلیون توکن یعنی چه؟
یعنی مدل میتواند در یک گفتوگو حدود هفتصد و پنجاه هزار کلمه را همزمان «در ذهن» داشته باشد — چیزی در حد چند جلد کتاب. برای مرور یک پروژهی کامل یا تحلیل اسناد بلند، این تعیینکننده است.
فارسی را خوب میفهمد؟
این خانواده در سنجههای چندزبانه امتیاز خوبی دارد، اما هیچ سنجهی عمومیای کیفیت فارسی را جداگانه اندازه نمیگیرد. توصیهی ما ساده است: یک نمونهی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.
چطور در هوشواره از آن استفاده کنم؟
مثل هر مدل دیگر: در صفحهی گفتوگو از فهرست مدلها انتخابش کنید. هزینهی هر پاسخ پیش و پس از ارسال بهصورت تومانی نمایش داده میشود. اگر توسعهدهندهاید، از طریق API هم در دسترس است.
جمعبندی
GLM-5.3 بهترین مدل جهان نیست و خودش هم چنین ادعایی ندارد. چیزی که هست جالبتر است: نسخهای که بدون عوضکردن مدل پایه، در کارهای چندمرحلهای و کدنویسی جهش کرده، در سه سنجه بالاتر از پرچمداران بسته ایستاده، همان کار را با توکن کمتری تمام میکند و این را با کسری از هزینهی آنها انجام میدهد — به شرط آنکه حواستان باشد نسبت به نسل قبلِ خودش گرانتر شده است.
سادهترین راه قضاوت، امتحانکردن با کار خودتان است. فهرست کامل مدلها و تعرفهی تومانی هرکدام در کاتالوگ مدلها و طرحهای اشتراک در صفحهی تعرفهها است. حساب ندارید؟ ثبتنام کمتر از یک دقیقه طول میکشد و میتوانید همین امروز مقایسه را خودتان انجام دهید.