Grok 4.6: بررسی کامل، بنچمارکها و مقایسهی هزینه با مدلهای پرچمدار
خانوادهی گروک پرچمدار تازهاش را منتشر کرد: Grok 4.6، یک مدل زبانی بزرگ با حافظهی گفتوگوی ۵۰۰ هزار توکنی که سازندهاش آن را صریحاً برای «عاملهای طولانی» ساخته است. این مقاله سه پرسش را جدا از هم جواب میدهد: واقعاً چه چیزی نسبت به نسل قبل عوض شده، در سنجههای منتشرشده کجا ایستاده، و — پرسشی که معمولاً از قلم میافتد — هزینهاش کنار بقیهی پرچمداران چقدر است.
Grok 4.6 دقیقاً چیست؟
گروک خانوادهی مدلهای زبانی شرکت xAI است و نسخهی ۴٫۶ یک بهروزرسانی نقطهای روی نسل ۴٫۵ بهحساب میآید — نه یک معماری تازه. تمرکز اعلامشدهی سازنده روی سه چیز است: کارهای چندمرحلهای که تا انتها دنبال میشوند، توانایی مدل در آزمودن کار خودش، و ساخت خروجیهای تعاملی و بصری. مشخصات کلیدی:
- پنجرهی متن ۵۰۰ هزار توکن — چیزی در حدود چند صد صفحه سند که یکجا جلوی مدل میگذارید.
- ورودی متن و تصویر، خروجی متن؛ یعنی میتوانید عکس، اسکرینشات یا نمودار را هم به گفتوگو بدهید.
- چهار سطح استدلال (از سبک تا بیشینه) — هرچه بالاتر، پاسخ دقیقتر و کندتر و پرهزینهتر.
- فراخوانی ابزار، خروجی ساختاریافته و اجرای کد — یعنی برای کارهای عاملی طراحی شده، نه فقط پرسشوپاسخ.
- مرز دانش: بهمن ۱۴۰۴ (فوریهی ۲۰۲۶)؛ برای رویدادهای تازهتر به جستوجوی وب تکیه میکند.
«عامل» یعنی مدلی که یک کار را تا انتها دنبال میکند: قدم بعدی را خودش انتخاب میکند، ابزار صدا میزند و نتیجه را میآزماید. تفاوتش با یک پاسخ خوب، مثل تفاوت نقشه با راننده است.
— تیم هوشواره
کارنامهی بنچمارکها: کجا جلو، کجا عقب
جدول زیر همان سنجههایی است که در معرفی رسمی منتشر شد. هر ستون، بالاترین سطح استدلالِ همان مدل است — یعنی مقایسه در سختگیرانهترین حالت انجام شده. عددهای بزرگتر بهترند.
| سنجه | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|
| AA Intelligence Index | ۶۱ | ۵۶ | ۶۱ | ۶۲ |
| GDPVal-AA v2 | ۱۷۵۳ | ۱۵۲۶ | ۱۷۲۸ | ۱۷۴۱ |
| CursorBench v3.2 | ۶۹٫۹ | ۶۶٫۷ | ۶۷٫۲ | ۷۰٫۵ |
| DeepSWE v1.1 | ۶۵٫۹ | ۵۴٫۰ | ۷۳٫۰ | ۷۰٫۰ |
| FrontierCode v1.1 | ۶۱٫۳ | ۵۶٫۶ | ۶۰٫۶ | ۶۳٫۶ |
| APEX-Agents | ۵۷٫۵ | ۴۷٫۱ | ۵۶٫۷ | ۵۹٫۲ |
| APEX-SWE | ۵۶٫۴ | ۵۳٫۶ | — | ۵۸٫۸ |
| Terminal-Bench v3.0 | ۲۶٫۰ | ۱۵٫۷ | ۳۴٫۶ | ۳۴٫۱ |
| AA-Briefcase | ۱۵۷۷ | ۱۳۱۳ | ۱۵۰۲ | ۱۵۷۴ |
| Harvey LAB | ۱۵٫۸ | ۱۲٫۹ | ۲٫۵ | ۱۱٫۳ |
نسبت به نسل قبل: جهش، نه وصله
روشنترین خواندنِ این جدول، ستون دوم در برابر ستون سوم است. در هر ده سنجه پیشرفت هست و در چند مورد فاصله بزرگ است: کار در خط فرمان از ۱۵٫۷ به ۲۶٫۰، مهندسی نرمافزار عمیق از ۵۴٫۰ به ۶۵٫۹، و کارهای عاملی چندمرحلهای از ۴۷٫۱ به ۵۷٫۵ رسیده. برای یک بهروزرسانی نقطهای، این شیب غیرعادی است.
کنار پرچمداران رقیب: تصویر یکدست نیست
در برابر رقبا اما داستان دو رو دارد و — برخلاف بیشتر معرفیهای محصول — بهتر است هر دو رو را ببینید. این مدل در کارهای دانشی و شغلی جلو میزند: در GDPVal و AA-Briefcase بالاتر از هر دو رقیب میایستد و در سنجهی کار حقوقی تخصصی فاصلهاش با یکی از پرچمداران چندبرابری است. در مقابل، در دو سنجهی مهندسی نرمافزارِ سنگین عقب میماند: در DeepSWE امتیاز ۶۵٫۹ در برابر ۷۳٫۰ میگیرد و در Terminal-Bench با ۲۶٫۰ بهروشنی پایینتر از هر دو رقیب است. پس این مدل صدرنشین مطلق نیست و ادعایش هم این نیست.
یک جدول بنچمارک به شما میگوید مدل در آزمونِ کسی دیگر چطور بوده، نه در کار شما. اگر کارتان دقیقاً شبیه هیچکدام از این ردیفها نیست — که معمولاً نیست — تنها آزمون معتبر، همان درخواست واقعی خودتان است.
مقایسهی هزینه: جایی که تفاوت واقعاً دیده میشود
برای اینکه مقایسه معنادار باشد، بهجای عدد مطلق از شاخص نسبی استفاده میکنیم: هزینهی Grok 4.6 را برابر ۱ میگیریم و بقیه را نسبت به آن میسنجیم. ستون آخر یک ترکیب واقعگرایانه از گفتوگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی) — چون در عمل معمولاً خیلی بیشتر از آنکه بخوانید، متن میفرستید.
| مدل | شاخص ورودی | شاخص خروجی | شاخص گفتوگوی معمول |
|---|---|---|---|
| Grok 4.6 | ۱٫۰ | ۱٫۰ | ۱٫۰۰ |
| Qwen 3.8 Max | ۱٫۰ | ۱٫۰ | ۱٫۰۰ |
| Claude Sonnet 5 | ۱٫۰ | ۱٫۷ | ۱٫۲۵ |
| Claude Opus 5 | ۲٫۵ | ۴٫۲ | ۳٫۱۳ |
| GPT-5.6 Sol | ۱٫۰ | ۱٫۷ | ۱٫۲۵ |
یعنی برای همان گفتوگو، گرانترین پرچمدار این فهرست نزدیک به سه برابر Grok 4.6 خرج برمیدارد — و مدلی هم که در دو سنجهی مهندسی نرمافزار از آن جلو زده بود، گرانتر از آن است. این دقیقاً همان معاملهای است که باید آگاهانه انجامش بدهید. یک تذکر لازم: این جدول عکسِ لحظهای تعرفههاست و تعرفهها تغییر میکنند؛ ارقام این جدول در ۱۹ شهریور ۱۴۰۵ بازبینی شدهاند؛ مرجع همیشگی، عدد بهروزِ هر مدل در کاتالوگ مدلهاست.
پلهی متن بلند: نکتهای که در جدول دیده نمیشود
Grok 4.6 یک پلهی قیمت دارد که باید بشناسیدش: بهمحض اینکه ورودی از مرز ۲۰۰ هزار توکن بگذرد، نرخ آن دو برابر میشود — و نکتهی مهم اینجاست که این نرخِ بالاتر روی همهی توکنها اعمال میشود، نه فقط روی مقدار مازاد. یعنی یک درخواست ۲۰۱ هزار توکنی تقریباً دو برابرِ یک درخواست ۱۹۹ هزار توکنی هزینه دارد.
در عمل این یعنی: تا مرز ۲۰۰ هزار توکن، این مدل یکی از باصرفهترین گزینههای ردهی پرچمدار است؛ بالاتر از آن مرز، اگر کارتان تحلیل اسناد خیلی بلند است، مدلی با نرخ تخت (مثل پرچمدار خانوادهی کوئن که تا نزدیک یک میلیون توکن پله ندارد) گزینهی سنجیدهتری است. خواندن از حافظهی نهان هم در Grok 4.6 حدود یکچهارم قیمت ورودی عادی است، پس اگر یک سند را یکبار میفرستید و بعد ده پرسش دربارهاش میکنید، پرسشهای بعدی بهمراتب ارزانترند.
پرسش درست «کدام مدل قویترین است؟» نیست، «ارزانترین مدلی که کار من را درست انجام میدهد کدام است؟» است. تفاوت این دو پرسش در صورتحساب ماهانه دیده میشود، نه در جدول بنچمارک.
— تیم هوشواره
پس چهوقت این مدل، چهوقت مدل دیگر؟
- سراغ Grok 4.6 بروید وقتی کار چندمرحلهای و عاملی دارید، با هوش مصنوعی کار دانشی و شغلی انجام میدهید، تصویر هم به گفتوگو میدهید، یا حجم درخواستتان بالاست و هزینه برایتان تعیینکننده است.
- سراغ پرچمدار رقیب بروید وقتی مسئلهی مهندسی نرمافزارِ سنگین و چندفایلی در کار است یا کارتان عمدتاً در خط فرمان میگذرد — دو جایی که جدول بالا صریحاً نشان میدهد عقب است.
- سراغ مدل سبک بروید برای ترجمهی کوتاه، خلاصه، دستهبندی و پاسخهای روزمره، که بخش بزرگی از کار واقعی همینهاست.
لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدلها همان درخواست واقعی خودتان را همزمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.
پرسشهای متداول
آیا Grok 4.6 از GPT و Claude بهتر است؟
نه بهطور مطلق. در کارهای دانشی و شغلی و سنجههای حقوقی جلوتر است؛ در مهندسی نرمافزار سنگین و کار در خط فرمان عقبتر. تفاوت اصلیاش کیفیت نیست، نسبت کیفیت به هزینه است.
تفاوتش با Grok 4.5 چقدر است؟
در هر ده سنجهی منتشرشده بالاتر است و در چند مورد فاصله بزرگ است. اگر روی نسل قبلی گردشکار عاملی ساختهاید، این نسخه ارزش امتحانکردن را دارد؛ هر دو در کاتالوگ مدلها در دسترساند.
پنجرهی ۵۰۰ هزار توکن یعنی چه؟
یعنی مدل میتواند در یک گفتوگو حدود سیصد و هفتاد هزار کلمه را همزمان «در ذهن» داشته باشد. فقط حواستان به پلهی قیمت بالای ۲۰۰ هزار توکن باشد که در بالا توضیح دادیم.
شنیدهام حافظهی گروک یک میلیون توکن است؛ کدام درست است؟
هر دو — ولی مال دو مدل متفاوت. نسخههای قدیمیترِ همین خانواده (گروک ۴٫۳ و گروک ۴٫۲۰) پنجرهی یکمیلیونتوکنی دارند، اما Grok 4.6 و Grok 4.5 روی ۵۰۰ هزار توکناند. بله، پرچمدار تازهتر پنجرهی کوچکتری دارد؛ در عوض در همهی سنجههای بالا جلوتر است. اگر کارتان واقعاً سند خیلی بلند است، آن نسخهها هم در کاتالوگ مدلها در دسترساند.
فارسی را خوب میفهمد؟
خانوادهی گروک در سنجههای چندزبانه امتیاز خوبی دارد، اما هیچ سنجهی عمومیای کیفیت فارسی را جداگانه اندازه نمیگیرد. توصیهی ما ساده است: یک نمونهی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.
چطور در هوشواره از آن استفاده کنم؟
مثل هر مدل دیگر: در صفحهی گفتوگو از فهرست مدلها انتخابش کنید. هزینهی هر پاسخ پیش و پس از ارسال بهصورت تومانی نمایش داده میشود. اگر توسعهدهندهاید، از طریق API هم در دسترس است.
جمعبندی
Grok 4.6 بهترین مدل جهان نیست و خودش هم چنین ادعایی ندارد. چیزی که هست جالبتر است: یک بهروزرسانی نقطهای که در هر ده سنجه از نسل قبلی جلو زده، در کارهای دانشی و عاملی به گرانترین پرچمداران رسیده، و این را با کسری از هزینهی آنها انجام میدهد — به شرط آنکه حواستان به پلهی متن بلند باشد.
سادهترین راه قضاوت، امتحانکردن با کار خودتان است. فهرست کامل مدلها و تعرفهی تومانی هرکدام در کاتالوگ مدلها و طرحهای اشتراک در صفحهی تعرفهها است. حساب ندارید؟ ثبتنام کمتر از یک دقیقه طول میکشد و میتوانید همین امروز مقایسه را خودتان انجام دهید.