Claude Opus 5.5: هم بهتر، هم ارزانتر — و خودِ سازنده میگوید به بنچمارکها تکیه نکنید
بعد از یک فصل که در آن تقریباً هر مدل تازهای یا گرانتر از نسل قبلش بود یا دستکم ارزانتر نبود، Claude Opus 5.5 استثناست: هم در سنجهها بالاتر رفته و هم ارزانتر شده — بیست درصد روی هر توکن و به گفتهی سازنده حدود چهل درصد روی یک کارِ تمامشده. جالبتر اینکه از مدل بزرگتر و گرانترِ خودِ همین شرکت هم در بیشتر ردیفها جلو میزند. در این مقاله میبینیم چه چیزی عوض شده، این ارزانشدن از کجا آمده، و چرا خودِ سازنده میگوید زیاد به این جدولها تکیه نکنید.
Claude Opus 5.5 دقیقاً چیست؟
بالاترین ردهی کاریِ خانوادهی Claude، یک مدل زبانی بزرگ از شرکت Anthropic و جانشین Opus 5. مشخصات کلیدی:
- پنجرهی متن یک میلیون توکن — چیزی در حدود هفتصد و پنجاه هزار کلمه در یک گفتوگو.
- پنج سطح تلاش (از کم تا بیشینه) با پیشفرض «متوسط». توجه کنید که در این نسخه خاموشکردن کامل استدلال ممکن نیست.
- حدود ۳۰ درصد سریعتر در تولید پاسخ نسبت به نسل قبل، و مصرف توکن بهمراتب کمتر برای همان کار.
- ورودی متن و تصویر، با تمرکز اعلامشده روی کدنویسی عاملی، کار با کامپیوتر و کار دانشی.
- یک حالت سریع اختیاری هم دارد که تا حدود دو و نیم برابر سرعت میدهد، در ازای دو برابر تعرفه.
کارنامهی بنچمارکها
جدول زیر ارقامی است که در معرفی رسمی منتشر شد. ستون سوم مدل بزرگتر و گرانترِ همین شرکت است و ستون چهارم نسل قبل. عددهای بزرگتر بهترند.
| سنجه | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 — کدنویسی عاملی | ۶۶٫۴ | ۵۵٫۸ | ۵۲٫۳ | ۵۷٫۹ |
| CursorBench 4.0 — کدنویسی در ویرایشگر | ۵۷٫۸ | ۵۱٫۸ | ۴۶٫۶ | — |
| FrontierCode v1.1 — کد مرزی | ۵۴٫۴ | ۵۰٫۳ | ۴۸٫۰ | ۵۳٫۳ |
| GDPval-AA v2.1 — کار دانشی | ۱۸۴۶ | ۱۷۳۵ | ۱۷۰۸ | ۱۵۴۲ |
| HLE — دانش و استدلال سطح بالا | ۶۷٫۷ | ۶۵٫۶ | ۶۳٫۶ | ۵۷٫۲ |
| OSWorld 2.0 — کار با کامپیوتر | ۸۱٫۸ | ۸۰٫۷ | ۷۴٫۰ | — |
| Chartography — خواندن نمودار | ۸۹٫۰ | ۸۸٫۴ | ۸۳٫۴ | — |
| AutomationBench — گردشکار اداری | ۴۰٫۰ | ۳۱٫۴ | ۲۶٫۹ | ۴۱٫۴ |
| Terminal-Bench-Science — پژوهش علمی | ۵۸٫۷ | ۵۲٫۶ | ۲۹٫۰ | ۶۴٫۶ |
دو چیز از این جدول بیرون میزند. اول: نسبت به نسل قبل جهش واقعی است — در کدنویسی عاملی از ۵۲٫۳ به ۶۶٫۴ و در پژوهش علمی از ۲۹٫۰ به ۵۸٫۷، یعنی دو برابر. دوم و غیرمنتظرهتر: در هفت ردیف از نُه ردیف از Fable 5.1 هم جلو میزند، مدلی که دو و نیم برابر گرانتر است.
اما تصویر یکدست نیست و بهتر است هر دو رو را ببینید: در خودکارسازی اداری و پژوهش علمی، GPT-6 Astra جلوتر میماند (۴۱٫۴ در برابر ۴۰٫۰ و ۶۴٫۶ در برابر ۵۸٫۷). پس این مدل صدرنشین مطلق نیست.
نکتهای که خودِ سازنده گفته و کمسابقه است
در همین معرفی، سازنده جملهای نوشته که معمولاً از شرکتها نمیشنویم: در این سطح از توانایی، فاصلهی چنددهمی در بنچمارکها دیگر راهنمای قابلاتکایی برای تفاوت واقعی نیست.
این حرف دقیقاً همان چیزی است که ما در هر معرفی تکرار کردهایم، اما شنیدنش از زبان کسی که خودش آن جدول را منتشر کرده وزن دیگری دارد. ترجمهی عملیاش برای شما: وقتی دو مدل در یک ردیف ۶۶ و ۶۵ میگیرند، آن یک واحد چیزی دربارهی کار شما نمیگوید. چیزی که میگوید، اجرای همان کار روی هر دو است.
وقتی سازندهای خودش مینویسد «به فاصلهی این اعداد تکیه نکنید»، این فروتنی نیست — اطلاعرسانی است. یعنی جدول به سقف خودش رسیده و از اینجا به بعد، تنها داورِ معتبر کار واقعی شماست.
ارزانتر، و نه فقط روی کاغذ
این بخش استثنای این فصل است. تعرفهی هر توکن بیست درصد کمتر از نسل قبل شده، و هزینهی «یادآوری» متن تکراری — حافظهی نهان — به دو پنجم رسیده. سازنده میگوید روی یک بار کارِ معمول، مجموع حدود چهل درصد ارزانتر تمام میشود، چون علاوه بر تعرفهی کمتر، توکن کمتری هم مصرف میکند.
چرا این برای شما مستقیم معنا دارد: در هوشواره آنچه از کیف پول کم میشود بر پایهی هزینهی واقعی همان درخواست حساب میشود، پس هر کاهشی که در بالادست اتفاق بیفتد مستقیم به صورتحساب شما میرسد، نه اینکه وسط راه بماند.
چند نمونهی عملی که سازنده منتشر کرده و جهت را نشان میدهد: بازبینی یک پایگاه کد دویستهزارخطی در حدود سه ساعت در برابر بیش از بیست ساعت با نسل قبل؛ و یک کار ترجمهی کد که نسبت به Fable 5.1 هم سریعتر و هم حدود نیمی ارزانتر تمام شده است.
مقایسهی هزینه
برای اینکه مقایسه معنادار باشد، هزینهی Opus 5.5 را برابر ۱ میگیریم. ستون آخر یک ترکیب واقعگرایانه از گفتوگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).
| مدل | شاخص ورودی | شاخص خروجی | شاخص حافظهی نهان | شاخص گفتوگوی معمول |
|---|---|---|---|---|
| Claude Opus 5.5 | ۱٫۰ | ۱٫۰ | ۱٫۰۰ | ۱٫۰۰ |
| Claude Opus 5 (نسل قبل) | ۱٫۲۵ | ۱٫۲۵ | ۲٫۵۰ | ۱٫۲۵ |
| Claude Fable 5.1 | ۲٫۵ | ۲٫۵ | ۱٫۲۵ | ۲٫۵۰ |
| GPT-6 Astra | ۲٫۵ | ۲٫۵ | ۵٫۰۰ | ۲٫۵۰ |
| Claude Sonnet 5 | ۰٫۵۰ | ۰٫۵۰ | ۱٫۰۰ | ۰٫۵۰ |
| GPT-5.6 Sol | ۰٫۵۰ | ۰٫۵۰ | ۱٫۰۰ | ۰٫۵۰ |
| GLM-5.3 | ۰٫۲۱ | ۰٫۱۳ | ۰٫۷۸ | ۰٫۱۷ |
| Gemini 3.8 Flash | ۰٫۱۹ | ۰٫۱۹ | ۰٫۳۸ | ۰٫۱۹ |
| DeepSeek V4.1 Flash | ۰٫۰۲۵ | ۰٫۰۲۵ | ۰٫۰۵ | ۰٫۰۲۵ |
ردیف سوم و چهارم مهمتریناند: دو مدلی که تا هفتهی پیش گرانترین گزینههای بازار بودند، حالا دو و نیم برابر این مدل خرج برمیدارند — در حالی که Opus 5.5 در بیشتر ردیفهای جدول بالا از یکیشان جلو زده. این ترکیبِ «هم بهتر، هم ارزانتر» در این فصل نادر بوده است.
یک استثنا در ستون حافظهی نهان هست که باید دید: Fable 5.1 در «یادآوری» متن تکراری کمی ارزانتر از Opus 5.5 است. اگر کارتان گفتوگوی بسیار طولانی روی یک زمینهی ثابت است، این ستون را جدا نگاه کنید.
و در انتهای دیگر جدول، مدلهای سبک همچنان دهها برابر ارزانترند؛ برای کار روزمره هنوز همانها انتخاب درستند. یک تذکر لازم: این جدول عکسِ لحظهای تعرفههاست و تعرفهها تغییر میکنند؛ ارقام این جدول در ۱ مهر ۱۴۰۵ بازبینی شدهاند و مرجع همیشگی، عدد بهروزِ هر مدل در کاتالوگ مدلهاست.
یک نسل تازه معمولاً یکی از این دو را به شما میدهد: کیفیت بیشتر، یا هزینهی کمتر. وقتی هر دو با هم میآیند، معنایش این است که پیشرفت از جای دیگری آمده — از اینکه مدل برای همان کار، کار کمتری لازم دارد.
— تیم هوشواره
دو تغییر که بهتر است از پیش بدانید
- درخواستهای امنیتی به مدل دیگری میرود. سازنده اعلام کرده کارهای مربوط به امنیت سایبری برای بیشتر کاربران به یک مدل قدیمیتر هدایت میشود. اگر در این حوزه کار میکنید و پاسخ را متفاوت دیدید، ایراد از پنل نیست.
- ایمنی و پایداری بهتر شده. به گزارش سازنده، این مدل بهمراتب کمتر از نسل قبل سراغ دور زدن محدودیتها میرود و در برابر «تزریق دستور» — حملهای که در آن متنِ ورودی میکوشد مدل را از کار اصلیاش منحرف کند — مقاومتر است. برای هر کسی که مدل را روی محتوای بیرونی و ناشناس اجرا میکند، این از چند واحد امتیاز بنچمارک مهمتر است.
پس چهوقت این مدل، چهوقت مدل دیگر؟
- سراغ Opus 5.5 بروید وقتی مسئله واقعاً سخت است: کدنویسی چندفایلی و طولانی، بازبینی یک پایگاه کد بزرگ، کار با کامپیوتر و مرورگر، یا کار دانشی که کیفیتش تعیینکننده است. اگر تا دیروز برای همین کارها سراغ ردهی گرانتر میرفتید، حالا دلیل کمتری برایش دارید.
- سراغ ردهی میانی بروید — مثل Claude Sonnet 5 یا GPT-5.6 Sol — برای کار حرفهای روزمره؛ نصف هزینه دارند.
- سراغ یک مدل سبک بروید برای ترجمه، خلاصه و پاسخ کوتاه. اختلاف هزینه دهها برابر است و در این دسته کارها معمولاً اختلاف کیفیتی حس نمیشود.
لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدلها همان درخواست واقعی خودتان را همزمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید — که با توجه به حرف خودِ سازنده دربارهی بنچمارکها، اینبار بیش از همیشه توصیهی درستی است.
پرسشهای متداول
اگر روی Opus 5 کار میکنم، ارتقا بدهم؟
تقریباً همیشه بله. هم در همهی سنجههای منتشرشده بالاتر است، هم ارزانتر، هم سریعتر. این ترکیب کم پیش میآید و دلیلی برای ماندن روی نسل قبل باقی نمیگذارد، مگر اینکه گردشکارتان به رفتار دقیق نسخهی قبلی وابسته باشد.
پس دیگر نیازی به مدل گرانتر نیست؟
برای بیشتر کارها نه. اما در دو ردیف — خودکارسازی اداری و پژوهش علمی — مدل رقیب هنوز جلوتر است، و Fable 5.1 هم در «یادآوری» متن تکراری کمی ارزانتر است. اگر کارتان دقیقاً از این جنس است، هنوز ارزش سنجیدن دارد.
چرا هم بهتر شده و هم ارزانتر؟
چون سرویسدادن به آن کمهزینهتر شده و برای همان کار توکن کمتری مصرف میکند. وقتی مدل هم سریعتر جواب میدهد و هم کمتر حرف میزند، تعرفهی پایینتر برای سازنده ممکن میشود؛ صورتحساب شما هم از هر دو جهت کم میشود.
فارسی را خوب میفهمد؟
خانوادهی Claude جزو قویترینها در کار چندزبانه است و سازنده میگوید در این نسخه نوشتن روانتر و کماصطلاحتر شده، اما هیچ سنجهی عمومیای کیفیت فارسی را جداگانه اندازه نمیگیرد. توصیهی ما ساده است: یک نمونهی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.
چطور در هوشواره از آن استفاده کنم؟
مثل هر مدل دیگر: در صفحهی گفتوگو از فهرست مدلها انتخابش کنید. هزینهی هر پاسخ پیش و پس از ارسال بهصورت تومانی نمایش داده میشود. اگر توسعهدهندهاید، از طریق API هم در دسترس است.
جمعبندی
Claude Opus 5.5 نادرترین نوع بهروزرسانی است: هم بهتر، هم ارزانتر، هم سریعتر. در بیشتر سنجهها از نسل قبل و حتی از مدل گرانترِ همخانوادهاش جلو میزند، بیست درصد ارزانتر است و روی یک کارِ کامل حدود چهل درصد. در عین حال در دو ردیف هنوز دنبالرو است و خودِ سازنده هم میگوید فاصلهی این اعداد را زیاد جدی نگیرید.
سادهترین راه قضاوت، امتحانکردن با کار خودتان است. فهرست کامل مدلها و تعرفهی تومانی هرکدام در کاتالوگ مدلها و طرحهای اشتراک در صفحهی تعرفهها است. حساب ندارید؟ ثبتنام کمتر از یک دقیقه طول میکشد.