Claude Opus 5.5: هم بهتر، هم ارزان‌تر — و خودِ سازنده می‌گوید به بنچمارک‌ها تکیه نکنید

Claude Opus 5.5: هم بهتر، هم ارزان‌تر — و خودِ سازنده می‌گوید به بنچمارک‌ها تکیه نکنید

Claude Opus 5.5 کلاد Anthropic مدل زبانی بزرگ مقایسه مدل‌های هوش مصنوعی هزینه هوش مصنوعی بنچمارک هوش مصنوعی کدنویسی با هوش مصنوعی هوش مصنوعی عاملی

بعد از یک فصل که در آن تقریباً هر مدل تازه‌ای یا گران‌تر از نسل قبلش بود یا دست‌کم ارزان‌تر نبود، Claude Opus 5.5 استثناست: هم در سنجه‌ها بالاتر رفته و هم ارزان‌تر شده — بیست درصد روی هر توکن و به گفته‌ی سازنده حدود چهل درصد روی یک کارِ تمام‌شده. جالب‌تر اینکه از مدل بزرگ‌تر و گران‌ترِ خودِ همین شرکت هم در بیشتر ردیف‌ها جلو می‌زند. در این مقاله می‌بینیم چه چیزی عوض شده، این ارزان‌شدن از کجا آمده، و چرا خودِ سازنده می‌گوید زیاد به این جدول‌ها تکیه نکنید.

Claude Opus 5.5 دقیقاً چیست؟

بالاترین رده‌ی کاریِ خانواده‌ی Claude، یک مدل زبانی بزرگ از شرکت Anthropic و جانشین Opus 5. مشخصات کلیدی:

  • پنجره‌ی متن یک میلیون توکن — چیزی در حدود هفتصد و پنجاه هزار کلمه در یک گفت‌وگو.
  • پنج سطح تلاش (از کم تا بیشینه) با پیش‌فرض «متوسط». توجه کنید که در این نسخه خاموش‌کردن کامل استدلال ممکن نیست.
  • حدود ۳۰ درصد سریع‌تر در تولید پاسخ نسبت به نسل قبل، و مصرف توکن به‌مراتب کمتر برای همان کار.
  • ورودی متن و تصویر، با تمرکز اعلام‌شده روی کدنویسی عاملی، کار با کامپیوتر و کار دانشی.
  • یک حالت سریع اختیاری هم دارد که تا حدود دو و نیم برابر سرعت می‌دهد، در ازای دو برابر تعرفه.

کارنامه‌ی بنچمارک‌ها

جدول زیر ارقامی است که در معرفی رسمی منتشر شد. ستون سوم مدل بزرگ‌تر و گران‌ترِ همین شرکت است و ستون چهارم نسل قبل. عددهای بزرگ‌تر بهترند.

سنجهOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.0 — کدنویسی عاملی۶۶٫۴۵۵٫۸۵۲٫۳۵۷٫۹
CursorBench 4.0 — کدنویسی در ویرایشگر۵۷٫۸۵۱٫۸۴۶٫۶—
FrontierCode v1.1 — کد مرزی۵۴٫۴۵۰٫۳۴۸٫۰۵۳٫۳
GDPval-AA v2.1 — کار دانشی۱۸۴۶۱۷۳۵۱۷۰۸۱۵۴۲
HLE — دانش و استدلال سطح بالا۶۷٫۷۶۵٫۶۶۳٫۶۵۷٫۲
OSWorld 2.0 — کار با کامپیوتر۸۱٫۸۸۰٫۷۷۴٫۰—
Chartography — خواندن نمودار۸۹٫۰۸۸٫۴۸۳٫۴—
AutomationBench — گردش‌کار اداری۴۰٫۰۳۱٫۴۲۶٫۹۴۱٫۴
Terminal-Bench-Science — پژوهش علمی۵۸٫۷۵۲٫۶۲۹٫۰۶۴٫۶

دو چیز از این جدول بیرون می‌زند. اول: نسبت به نسل قبل جهش واقعی است — در کدنویسی عاملی از ۵۲٫۳ به ۶۶٫۴ و در پژوهش علمی از ۲۹٫۰ به ۵۸٫۷، یعنی دو برابر. دوم و غیرمنتظره‌تر: در هفت ردیف از نُه ردیف از Fable 5.1 هم جلو می‌زند، مدلی که دو و نیم برابر گران‌تر است.

اما تصویر یکدست نیست و بهتر است هر دو رو را ببینید: در خودکارسازی اداری و پژوهش علمی، GPT-6 Astra جلوتر می‌ماند (۴۱٫۴ در برابر ۴۰٫۰ و ۶۴٫۶ در برابر ۵۸٫۷). پس این مدل صدرنشین مطلق نیست.

نکته‌ای که خودِ سازنده گفته و کم‌سابقه است

در همین معرفی، سازنده جمله‌ای نوشته که معمولاً از شرکت‌ها نمی‌شنویم: در این سطح از توانایی، فاصله‌ی چنددهمی در بنچمارک‌ها دیگر راهنمای قابل‌اتکایی برای تفاوت واقعی نیست.

این حرف دقیقاً همان چیزی است که ما در هر معرفی تکرار کرده‌ایم، اما شنیدنش از زبان کسی که خودش آن جدول را منتشر کرده وزن دیگری دارد. ترجمه‌ی عملی‌اش برای شما: وقتی دو مدل در یک ردیف ۶۶ و ۶۵ می‌گیرند، آن یک واحد چیزی درباره‌ی کار شما نمی‌گوید. چیزی که می‌گوید، اجرای همان کار روی هر دو است.

وقتی سازنده‌ای خودش می‌نویسد «به فاصله‌ی این اعداد تکیه نکنید»، این فروتنی نیست — اطلاع‌رسانی است. یعنی جدول به سقف خودش رسیده و از اینجا به بعد، تنها داورِ معتبر کار واقعی شماست.

ارزان‌تر، و نه فقط روی کاغذ

این بخش استثنای این فصل است. تعرفه‌ی هر توکن بیست درصد کمتر از نسل قبل شده، و هزینه‌ی «یادآوری» متن تکراری — حافظه‌ی نهان — به دو پنجم رسیده. سازنده می‌گوید روی یک بار کارِ معمول، مجموع حدود چهل درصد ارزان‌تر تمام می‌شود، چون علاوه بر تعرفه‌ی کمتر، توکن کمتری هم مصرف می‌کند.

چرا این برای شما مستقیم معنا دارد: در هوشواره آنچه از کیف پول کم می‌شود بر پایه‌ی هزینه‌ی واقعی همان درخواست حساب می‌شود، پس هر کاهشی که در بالادست اتفاق بیفتد مستقیم به صورت‌حساب شما می‌رسد، نه اینکه وسط راه بماند.

چند نمونه‌ی عملی که سازنده منتشر کرده و جهت را نشان می‌دهد: بازبینی یک پایگاه کد دویست‌هزارخطی در حدود سه ساعت در برابر بیش از بیست ساعت با نسل قبل؛ و یک کار ترجمه‌ی کد که نسبت به Fable 5.1 هم سریع‌تر و هم حدود نیمی ارزان‌تر تمام شده است.

مقایسه‌ی هزینه

برای اینکه مقایسه معنادار باشد، هزینه‌ی Opus 5.5 را برابر ۱ می‌گیریم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).

مدلشاخص ورودیشاخص خروجیشاخص حافظه‌ی نهانشاخص گفت‌وگوی معمول
Claude Opus 5.5۱٫۰۱٫۰۱٫۰۰۱٫۰۰
Claude Opus 5 (نسل قبل)۱٫۲۵۱٫۲۵۲٫۵۰۱٫۲۵
Claude Fable 5.1۲٫۵۲٫۵۱٫۲۵۲٫۵۰
GPT-6 Astra۲٫۵۲٫۵۵٫۰۰۲٫۵۰
Claude Sonnet 5۰٫۵۰۰٫۵۰۱٫۰۰۰٫۵۰
GPT-5.6 Sol۰٫۵۰۰٫۵۰۱٫۰۰۰٫۵۰
GLM-5.3۰٫۲۱۰٫۱۳۰٫۷۸۰٫۱۷
Gemini 3.8 Flash۰٫۱۹۰٫۱۹۰٫۳۸۰٫۱۹
DeepSeek V4.1 Flash۰٫۰۲۵۰٫۰۲۵۰٫۰۵۰٫۰۲۵

ردیف سوم و چهارم مهم‌ترین‌اند: دو مدلی که تا هفته‌ی پیش گران‌ترین گزینه‌های بازار بودند، حالا دو و نیم برابر این مدل خرج برمی‌دارند — در حالی که Opus 5.5 در بیشتر ردیف‌های جدول بالا از یکی‌شان جلو زده. این ترکیبِ «هم بهتر، هم ارزان‌تر» در این فصل نادر بوده است.

یک استثنا در ستون حافظه‌ی نهان هست که باید دید: Fable 5.1 در «یادآوری» متن تکراری کمی ارزان‌تر از Opus 5.5 است. اگر کارتان گفت‌وگوی بسیار طولانی روی یک زمینه‌ی ثابت است، این ستون را جدا نگاه کنید.

و در انتهای دیگر جدول، مدل‌های سبک همچنان ده‌ها برابر ارزان‌ترند؛ برای کار روزمره هنوز همان‌ها انتخاب درستند. یک تذکر لازم: این جدول عکسِ لحظه‌ای تعرفه‌هاست و تعرفه‌ها تغییر می‌کنند؛ ارقام این جدول در ۱ مهر ۱۴۰۵ بازبینی شده‌اند و مرجع همیشگی، عدد به‌روزِ هر مدل در کاتالوگ مدل‌هاست.

یک نسل تازه معمولاً یکی از این دو را به شما می‌دهد: کیفیت بیشتر، یا هزینه‌ی کمتر. وقتی هر دو با هم می‌آیند، معنایش این است که پیشرفت از جای دیگری آمده — از اینکه مدل برای همان کار، کار کمتری لازم دارد.

— تیم هوشواره

دو تغییر که بهتر است از پیش بدانید

  • درخواست‌های امنیتی به مدل دیگری می‌رود. سازنده اعلام کرده کارهای مربوط به امنیت سایبری برای بیشتر کاربران به یک مدل قدیمی‌تر هدایت می‌شود. اگر در این حوزه کار می‌کنید و پاسخ را متفاوت دیدید، ایراد از پنل نیست.
  • ایمنی و پایداری بهتر شده. به گزارش سازنده، این مدل به‌مراتب کمتر از نسل قبل سراغ دور زدن محدودیت‌ها می‌رود و در برابر «تزریق دستور» — حمله‌ای که در آن متنِ ورودی می‌کوشد مدل را از کار اصلی‌اش منحرف کند — مقاوم‌تر است. برای هر کسی که مدل را روی محتوای بیرونی و ناشناس اجرا می‌کند، این از چند واحد امتیاز بنچمارک مهم‌تر است.

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

  • سراغ Opus 5.5 بروید وقتی مسئله واقعاً سخت است: کدنویسی چندفایلی و طولانی، بازبینی یک پایگاه کد بزرگ، کار با کامپیوتر و مرورگر، یا کار دانشی که کیفیتش تعیین‌کننده است. اگر تا دیروز برای همین کارها سراغ رده‌ی گران‌تر می‌رفتید، حالا دلیل کمتری برایش دارید.
  • سراغ رده‌ی میانی بروید — مثل Claude Sonnet 5 یا GPT-5.6 Sol — برای کار حرفه‌ای روزمره؛ نصف هزینه دارند.
  • سراغ یک مدل سبک بروید برای ترجمه، خلاصه و پاسخ کوتاه. اختلاف هزینه ده‌ها برابر است و در این دسته کارها معمولاً اختلاف کیفیتی حس نمی‌شود.

لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدل‌ها همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید — که با توجه به حرف خودِ سازنده درباره‌ی بنچمارک‌ها، این‌بار بیش از همیشه توصیه‌ی درستی است.

پرسش‌های متداول

اگر روی Opus 5 کار می‌کنم، ارتقا بدهم؟

تقریباً همیشه بله. هم در همه‌ی سنجه‌های منتشرشده بالاتر است، هم ارزان‌تر، هم سریع‌تر. این ترکیب کم پیش می‌آید و دلیلی برای ماندن روی نسل قبل باقی نمی‌گذارد، مگر اینکه گردش‌کارتان به رفتار دقیق نسخه‌ی قبلی وابسته باشد.

پس دیگر نیازی به مدل گران‌تر نیست؟

برای بیشتر کارها نه. اما در دو ردیف — خودکارسازی اداری و پژوهش علمی — مدل رقیب هنوز جلوتر است، و Fable 5.1 هم در «یادآوری» متن تکراری کمی ارزان‌تر است. اگر کارتان دقیقاً از این جنس است، هنوز ارزش سنجیدن دارد.

چرا هم بهتر شده و هم ارزان‌تر؟

چون سرویس‌دادن به آن کم‌هزینه‌تر شده و برای همان کار توکن کمتری مصرف می‌کند. وقتی مدل هم سریع‌تر جواب می‌دهد و هم کمتر حرف می‌زند، تعرفه‌ی پایین‌تر برای سازنده ممکن می‌شود؛ صورت‌حساب شما هم از هر دو جهت کم می‌شود.

فارسی را خوب می‌فهمد؟

خانواده‌ی Claude جزو قوی‌ترین‌ها در کار چندزبانه است و سازنده می‌گوید در این نسخه نوشتن روان‌تر و کم‌اصطلاح‌تر شده، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

Claude Opus 5.5 نادرترین نوع به‌روزرسانی است: هم بهتر، هم ارزان‌تر، هم سریع‌تر. در بیشتر سنجه‌ها از نسل قبل و حتی از مدل گران‌ترِ هم‌خانواده‌اش جلو می‌زند، بیست درصد ارزان‌تر است و روی یک کارِ کامل حدود چهل درصد. در عین حال در دو ردیف هنوز دنبال‌رو است و خودِ سازنده هم می‌گوید فاصله‌ی این اعداد را زیاد جدی نگیرید.

ساده‌ترین راه قضاوت، امتحان‌کردن با کار خودتان است. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد.

مطالب دیگر