Grok 4.6: بررسی کامل، بنچمارک‌ها و مقایسه‌ی هزینه با مدل‌های پرچم‌دار

خانواده‌ی گروک پرچم‌دار تازه‌اش را منتشر کرد: Grok 4.6، یک مدل زبانی بزرگ با حافظه‌ی گفت‌وگوی ۵۰۰ هزار توکنی که سازنده‌اش آن را صریحاً برای «عامل‌های طولانی» ساخته است. این مقاله سه پرسش را جدا از هم جواب می‌دهد: واقعاً چه چیزی نسبت به نسل قبل عوض شده، در سنجه‌های منتشرشده کجا ایستاده، و — پرسشی که معمولاً از قلم می‌افتد — هزینه‌اش کنار بقیه‌ی پرچم‌داران چقدر است.

Grok 4.6 دقیقاً چیست؟

گروک خانواده‌ی مدل‌های زبانی شرکت xAI است و نسخه‌ی ۴٫۶ یک به‌روزرسانی نقطه‌ای روی نسل ۴٫۵ به‌حساب می‌آید — نه یک معماری تازه. تمرکز اعلام‌شده‌ی سازنده روی سه چیز است: کارهای چندمرحله‌ای که تا انتها دنبال می‌شوند، توانایی مدل در آزمودن کار خودش، و ساخت خروجی‌های تعاملی و بصری. مشخصات کلیدی:

  • پنجره‌ی متن ۵۰۰ هزار توکن — چیزی در حدود چند صد صفحه سند که یک‌جا جلوی مدل می‌گذارید.
  • ورودی متن و تصویر، خروجی متن؛ یعنی می‌توانید عکس، اسکرین‌شات یا نمودار را هم به گفت‌وگو بدهید.
  • چهار سطح استدلال (از سبک تا بیشینه) — هرچه بالاتر، پاسخ دقیق‌تر و کندتر و پرهزینه‌تر.
  • فراخوانی ابزار، خروجی ساختاریافته و اجرای کد — یعنی برای کارهای عاملی طراحی شده، نه فقط پرسش‌وپاسخ.
  • مرز دانش: بهمن ۱۴۰۴ (فوریه‌ی ۲۰۲۶)؛ برای رویدادهای تازه‌تر به جست‌وجوی وب تکیه می‌کند.

«عامل» یعنی مدلی که یک کار را تا انتها دنبال می‌کند: قدم بعدی را خودش انتخاب می‌کند، ابزار صدا می‌زند و نتیجه را می‌آزماید. تفاوتش با یک پاسخ خوب، مثل تفاوت نقشه با راننده است.

— تیم هوشواره

کارنامه‌ی بنچمارک‌ها: کجا جلو، کجا عقب

جدول زیر همان سنجه‌هایی است که در معرفی رسمی منتشر شد. هر ستون، بالاترین سطح استدلالِ همان مدل است — یعنی مقایسه در سخت‌گیرانه‌ترین حالت انجام شده. عددهای بزرگ‌تر بهترند.

سنجهGrok 4.6Grok 4.5GPT-5.6 SolClaude Fable 5
AA Intelligence Index۶۱۵۶۶۱۶۲
GDPVal-AA v2۱۷۵۳۱۵۲۶۱۷۲۸۱۷۴۱
CursorBench v3.2۶۹٫۹۶۶٫۷۶۷٫۲۷۰٫۵
DeepSWE v1.1۶۵٫۹۵۴٫۰۷۳٫۰۷۰٫۰
FrontierCode v1.1۶۱٫۳۵۶٫۶۶۰٫۶۶۳٫۶
APEX-Agents۵۷٫۵۴۷٫۱۵۶٫۷۵۹٫۲
APEX-SWE۵۶٫۴۵۳٫۶۵۸٫۸
Terminal-Bench v3.0۲۶٫۰۱۵٫۷۳۴٫۶۳۴٫۱
AA-Briefcase۱۵۷۷۱۳۱۳۱۵۰۲۱۵۷۴
Harvey LAB۱۵٫۸۱۲٫۹۲٫۵۱۱٫۳

نسبت به نسل قبل: جهش، نه وصله

روشن‌ترین خواندنِ این جدول، ستون دوم در برابر ستون سوم است. در هر ده سنجه پیشرفت هست و در چند مورد فاصله بزرگ است: کار در خط فرمان از ۱۵٫۷ به ۲۶٫۰، مهندسی نرم‌افزار عمیق از ۵۴٫۰ به ۶۵٫۹، و کارهای عاملی چندمرحله‌ای از ۴۷٫۱ به ۵۷٫۵ رسیده. برای یک به‌روزرسانی نقطه‌ای، این شیب غیرعادی است.

کنار پرچم‌داران رقیب: تصویر یکدست نیست

در برابر رقبا اما داستان دو رو دارد و — برخلاف بیشتر معرفی‌های محصول — بهتر است هر دو رو را ببینید. این مدل در کارهای دانشی و شغلی جلو می‌زند: در GDPVal و AA-Briefcase بالاتر از هر دو رقیب می‌ایستد و در سنجه‌ی کار حقوقی تخصصی فاصله‌اش با یکی از پرچم‌داران چندبرابری است. در مقابل، در دو سنجه‌ی مهندسی نرم‌افزارِ سنگین عقب می‌ماند: در DeepSWE امتیاز ۶۵٫۹ در برابر ۷۳٫۰ می‌گیرد و در Terminal-Bench با ۲۶٫۰ به‌روشنی پایین‌تر از هر دو رقیب است. پس این مدل صدرنشین مطلق نیست و ادعایش هم این نیست.

یک جدول بنچمارک به شما می‌گوید مدل در آزمونِ کسی دیگر چطور بوده، نه در کار شما. اگر کارتان دقیقاً شبیه هیچ‌کدام از این ردیف‌ها نیست — که معمولاً نیست — تنها آزمون معتبر، همان درخواست واقعی خودتان است.

مقایسه‌ی هزینه: جایی که تفاوت واقعاً دیده می‌شود

برای اینکه مقایسه معنادار باشد، به‌جای عدد مطلق از شاخص نسبی استفاده می‌کنیم: هزینه‌ی Grok 4.6 را برابر ۱ می‌گیریم و بقیه را نسبت به آن می‌سنجیم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی) — چون در عمل معمولاً خیلی بیشتر از آنکه بخوانید، متن می‌فرستید.

مدلشاخص ورودیشاخص خروجیشاخص گفت‌وگوی معمول
Grok 4.6۱٫۰۱٫۰۱٫۰۰
Qwen 3.8 Max۱٫۰۱٫۰۱٫۰۰
Claude Sonnet 5۱٫۰۱٫۷۱٫۲۵
Claude Opus 5۲٫۵۴٫۲۳٫۱۳
GPT-5.6 Sol۱٫۰۱٫۷۱٫۲۵

یعنی برای همان گفت‌وگو، گران‌ترین پرچم‌دار این فهرست نزدیک به سه برابر Grok 4.6 خرج برمی‌دارد — و مدلی هم که در دو سنجه‌ی مهندسی نرم‌افزار از آن جلو زده بود، گران‌تر از آن است. این دقیقاً همان معامله‌ای است که باید آگاهانه انجامش بدهید. یک تذکر لازم: این جدول عکسِ لحظه‌ای تعرفه‌هاست و تعرفه‌ها تغییر می‌کنند؛ ارقام این جدول در ۱۹ شهریور ۱۴۰۵ بازبینی شده‌اند؛ مرجع همیشگی، عدد به‌روزِ هر مدل در کاتالوگ مدل‌هاست.

پله‌ی متن بلند: نکته‌ای که در جدول دیده نمی‌شود

Grok 4.6 یک پله‌ی قیمت دارد که باید بشناسیدش: به‌محض اینکه ورودی از مرز ۲۰۰ هزار توکن بگذرد، نرخ آن دو برابر می‌شود — و نکته‌ی مهم اینجاست که این نرخِ بالاتر روی همه‌ی توکن‌ها اعمال می‌شود، نه فقط روی مقدار مازاد. یعنی یک درخواست ۲۰۱ هزار توکنی تقریباً دو برابرِ یک درخواست ۱۹۹ هزار توکنی هزینه دارد.

در عمل این یعنی: تا مرز ۲۰۰ هزار توکن، این مدل یکی از باصرفه‌ترین گزینه‌های رده‌ی پرچم‌دار است؛ بالاتر از آن مرز، اگر کارتان تحلیل اسناد خیلی بلند است، مدلی با نرخ تخت (مثل پرچم‌دار خانواده‌ی کوئن که تا نزدیک یک میلیون توکن پله ندارد) گزینه‌ی سنجیده‌تری است. خواندن از حافظه‌ی نهان هم در Grok 4.6 حدود یک‌چهارم قیمت ورودی عادی است، پس اگر یک سند را یک‌بار می‌فرستید و بعد ده پرسش درباره‌اش می‌کنید، پرسش‌های بعدی به‌مراتب ارزان‌ترند.

پرسش درست «کدام مدل قوی‌ترین است؟» نیست، «ارزان‌ترین مدلی که کار من را درست انجام می‌دهد کدام است؟» است. تفاوت این دو پرسش در صورت‌حساب ماهانه دیده می‌شود، نه در جدول بنچمارک.

— تیم هوشواره

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

  • سراغ Grok 4.6 بروید وقتی کار چندمرحله‌ای و عاملی دارید، با هوش مصنوعی کار دانشی و شغلی انجام می‌دهید، تصویر هم به گفت‌وگو می‌دهید، یا حجم درخواست‌تان بالاست و هزینه برایتان تعیین‌کننده است.
  • سراغ پرچم‌دار رقیب بروید وقتی مسئله‌ی مهندسی نرم‌افزارِ سنگین و چندفایلی در کار است یا کارتان عمدتاً در خط فرمان می‌گذرد — دو جایی که جدول بالا صریحاً نشان می‌دهد عقب است.
  • سراغ مدل سبک بروید برای ترجمه‌ی کوتاه، خلاصه، دسته‌بندی و پاسخ‌های روزمره، که بخش بزرگی از کار واقعی همین‌هاست.

لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدل‌ها همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.

پرسش‌های متداول

آیا Grok 4.6 از GPT و Claude بهتر است؟

نه به‌طور مطلق. در کارهای دانشی و شغلی و سنجه‌های حقوقی جلوتر است؛ در مهندسی نرم‌افزار سنگین و کار در خط فرمان عقب‌تر. تفاوت اصلی‌اش کیفیت نیست، نسبت کیفیت به هزینه است.

تفاوتش با Grok 4.5 چقدر است؟

در هر ده سنجه‌ی منتشرشده بالاتر است و در چند مورد فاصله بزرگ است. اگر روی نسل قبلی گردش‌کار عاملی ساخته‌اید، این نسخه ارزش امتحان‌کردن را دارد؛ هر دو در کاتالوگ مدل‌ها در دسترس‌اند.

پنجره‌ی ۵۰۰ هزار توکن یعنی چه؟

یعنی مدل می‌تواند در یک گفت‌وگو حدود سیصد و هفتاد هزار کلمه را هم‌زمان «در ذهن» داشته باشد. فقط حواستان به پله‌ی قیمت بالای ۲۰۰ هزار توکن باشد که در بالا توضیح دادیم.

شنیده‌ام حافظه‌ی گروک یک میلیون توکن است؛ کدام درست است؟

هر دو — ولی مال دو مدل متفاوت. نسخه‌های قدیمی‌ترِ همین خانواده (گروک ۴٫۳ و گروک ۴٫۲۰) پنجره‌ی یک‌میلیون‌توکنی دارند، اما Grok 4.6 و Grok 4.5 روی ۵۰۰ هزار توکن‌اند. بله، پرچم‌دار تازه‌تر پنجره‌ی کوچک‌تری دارد؛ در عوض در همه‌ی سنجه‌های بالا جلوتر است. اگر کارتان واقعاً سند خیلی بلند است، آن نسخه‌ها هم در کاتالوگ مدل‌ها در دسترس‌اند.

فارسی را خوب می‌فهمد؟

خانواده‌ی گروک در سنجه‌های چندزبانه امتیاز خوبی دارد، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

Grok 4.6 بهترین مدل جهان نیست و خودش هم چنین ادعایی ندارد. چیزی که هست جالب‌تر است: یک به‌روزرسانی نقطه‌ای که در هر ده سنجه از نسل قبلی جلو زده، در کارهای دانشی و عاملی به گران‌ترین پرچم‌داران رسیده، و این را با کسری از هزینه‌ی آن‌ها انجام می‌دهد — به شرط آنکه حواستان به پله‌ی متن بلند باشد.

ساده‌ترین راه قضاوت، امتحان‌کردن با کار خودتان است. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد و می‌توانید همین امروز مقایسه را خودتان انجام دهید.

مطالب دیگر