Claude Fable 5.1: بررسی کامل، بنچمارکها و تغییری که در صورتحساب دیده میشود
خانوادهی Claude نسخهی تازهی پرچمدارش را منتشر کرد: Claude Fable 5.1. نکتهی غیرمعمول این انتشار این است که تعرفهی ورودی و خروجیاش دقیقاً همان نسل قبل است — اما در سنجههای منتشرشده از نسل قبل و از رقبا جلو میزند، و یک تغییر قیمتی دارد که در جدول اصلی دیده نمیشود ولی در صورتحساب ماهانهی شما دیده میشود. در این مقاله سه چیز را جدا از هم میبینیم: چه چیزی عوض شده، در سنجهها کجا ایستاده، و آن تغییر پنهانِ هزینه دقیقاً برای چه کسانی معنا دارد.
Claude Fable 5.1 دقیقاً چیست؟
یک مدل زبانی بزرگ از شرکت Anthropic و بالاترین ردهی خانوادهی Claude. نسخهی ۵٫۱ یک بهروزرسانی روی Fable 5 است، نه یک معماری تازه. مشخصات کلیدی:
- پنجرهی متن یک میلیون توکن — چیزی در حدود هفتصد و پنجاه هزار کلمه در یک گفتوگو.
- پنج سطح تلاش: کم، متوسط، زیاد، خیلیزیاد و بیشینه. هرچه بالاتر، پاسخ دقیقتر و کندتر و پرهزینهتر؛ انتخاب درستِ این سطح یکی از مؤثرترین کارهایی است که میتوانید برای کنترل هزینه بکنید.
- تمرکز بر کارهای طولانی و چندمرحلهای — سازنده میگوید مدل در کارهای طولانی «خوانا» میماند، یعنی هرچه بیشتر کار میکند دنبالکردن کارش سختتر نمیشود؛ همان چیزی که در نسلهای قبل شکایت رایجی بود.
- ورودی متن و تصویر، و توانایی کار با محیط کامپیوتر و مرورگر.
سازنده همزمان مدل دیگری به نام Mythos 5.1 معرفی کرده که به گفتهی خودش همان مدل است با سطح متفاوتی از محافظهای ایمنی، و دسترسی به آن محدود به برنامههای تأییدشدهی تخصصی است. آنچه در دسترس عموم — و در هوشواره — قرار دارد، Fable 5.1 است.
کارنامهی بنچمارکها
جدول زیر سنجههایی است که در معرفی رسمی منتشر شد. عددهای بزرگتر بهترند.
| سنجه | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 — کدنویسی عاملی | ۵۵٫۸ | ۴۲٫۰ | ۵۲٫۳ | ۳۷٫۳ |
| Terminal-Bench-Science — پژوهش علمی | ۵۲٫۶ | ۲۴٫۷ | ۲۹٫۰ | ۲۲٫۴ |
| CursorBench 3.2 — کدنویسی در ویرایشگر | ۷۳٫۴ | ۷۰٫۵ | ۷۰٫۰ | ۶۷٫۲ |
| AutomationBench — گردشکار اداری | ۳۱٫۴ | ۱۷٫۱ | ۲۶٫۹ | ۱۹٫۶ |
| GDPval-AA v2 — کار دانشی | ۱۸۵۳ | ۱۷۲۳ | ۱۸۲۴ | ۱۷۱۱ |
| OSWorld 2.0 — کار با کامپیوتر (جزئی) | ۷۷٫۹ | ۷۲٫۹ | ۷۵٫۴ | — |
| OSWorld 2.0 — کار با کامپیوتر (کامل) | ۴۱٫۷ | ۳۶٫۱ | ۳۹٫۶ | — |
| HLE — بدون ابزار | ۶۰٫۹ | ۵۷٫۸ | ۵۶٫۶ | — |
| HLE — با ابزار | ۶۵٫۰ | ۶۳٫۸ | ۶۳٫۶ | — |
خواندن این جدول ساده است، چون تصویرش برخلاف بیشتر انتشارها یکدست است: در هر نُه ردیف، Fable 5.1 بالاترین عدد را دارد. در چند مورد فاصله با نسل قبل بزرگ است — پژوهش علمی عاملی بیش از دو برابر شده (۲۴٫۷ به ۵۲٫۶) و گردشکار اداری تقریباً دو برابر (۱۷٫۱ به ۳۱٫۴).
اما یک تذکر لازم که در هیچ معرفی رسمیای نمیآید: این اعداد را خودِ سازنده منتشر کرده، با ابزار و تنظیمات خودش. جدولی که در آن یک مدل همهی ردیفها را میبرد، دقیقاً همان جدولی است که باید با احتیاط بیشتری خوانده شود — نه به این معنا که غلط است، بلکه به این معنا که تنها آزمون معتبر برای شما، کار واقعی خودتان است.
وقتی یک مدل در همهی ردیفهای جدولِ سازندهاش اول میشود، چیزی که یاد گرفتهاید این است که سازنده کدام ردیفها را برای انتشار انتخاب کرده — نه اینکه مدل در کار شما هم اول میشود.
— تیم هوشواره
تغییری که در جدول قیمت دیده نمیشود
تعرفهی ورودی و خروجی Fable 5.1 دقیقاً برابر Fable 5 است. اما یک عدد سوم هم هست که کمتر کسی نگاهش میکند و اینبار یکچهارم شده: هزینهی خواندن از حافظهی نهان.
توضیح سادهاش این است: وقتی در یک گفتوگو بارها همان متن اولیه را میفرستید — یک سند بلند، یک پروندهی کد، دستورالعملهای ثابت — مدل لازم نیست هر بار از صفر آن را بخواند. بخش تکراری در حافظهی نهان میماند و دفعات بعد با تعرفهی بهمراتب ارزانتری حساب میشود. در Fable 5 آن تعرفه یکدهمِ ورودی عادی بود؛ در Fable 5.1 به یکچهلم رسیده است.
چرا این برای شما مهم است: در هوشواره آنچه از کیف پول شما کم میشود بر پایهی هزینهی واقعیِ همان درخواست محاسبه میشود، پس هر صرفهجوییای که در بالادست اتفاق بیفتد مستقیم به صورتحساب شما میرسد — نه اینکه جایی وسط راه بماند. سازنده تخمین میزند این تغییر هزینهی کارهای معمول را حدود یکچهارم و کارهای عاملیِ سنگین را تا حدود ۴۵ درصد پایین میآورد.
و یک نکتهی صادقانه در کنارش: این صرفهجویی فقط وقتی اتفاق میافتد که گفتوگو ادامهدار باشد. اگر هر بار یک پرسش کوتاهِ تازه میپرسید، چیزی برای دوبارهخواندن وجود ندارد و این تخفیف عملاً به شما نمیرسد. بیشترین سود را کسی میبرد که ساعتها روی یک پروندهی کد یا یک سند بلند کار میکند.
مقایسهی هزینه
برای اینکه مقایسه معنادار باشد، بهجای عدد مطلق از شاخص نسبی استفاده میکنیم: هزینهی Fable 5.1 را برابر ۱ میگیریم و بقیه را نسبت به آن میسنجیم. ستون آخر یک ترکیب واقعگرایانه از گفتوگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).
| مدل | ورودی | خروجی | خواندن از حافظهی نهان | گفتوگوی معمول |
|---|---|---|---|---|
| Claude Fable 5.1 | ۱٫۰ | ۱٫۰ | ۱٫۰ | ۱٫۰۰ |
| Claude Fable 5 (نسل قبل) | ۱٫۰ | ۱٫۰ | ۴٫۰ | ۱٫۰۰ |
| Claude Opus 5 | ۰٫۵ | ۰٫۵ | ۲٫۰ | ۰٫۵۰ |
| Claude Sonnet 5 | ۰٫۲ | ۰٫۲ | ۰٫۸ | ۰٫۲۰ |
| GPT-5.6 Sol | ۰٫۲ | ۰٫۲ | ۰٫۸ | ۰٫۲۰ |
| GLM-5.3 | ۰٫۱۴ | ۰٫۰۹ | ۱٫۰۴ | ۰٫۱۱ |
| GLM-5.3 Flash | ۰٫۰۰۸ | ۰٫۰۰۵ | ۰٫۰۶ | ۰٫۰۱ |
دو ردیف اول تمام حرفِ این انتشار است: ورودی و خروجی یکسان، اما ستون حافظهی نهان چهار برابر. یعنی برای کار کوتاه، Fable 5.1 و نسل قبلش هزینهی یکسانی دارند و انتخاب بدیهی است؛ برای کار طولانی، نسل قبل بهمراتب گرانتر تمام میشود.
بقیهی جدول هم تصویر روشنی میدهد: این گرانترین ردهای است که میتوانید انتخاب کنید. یک مدل سبک مثل GLM-5.3 Flash برای همان گفتوگو حدود یکصدم خرج برمیدارد. تفاوت کیفیت در سنجهها معمولاً چند درصد است و تفاوت هزینه چند ده برابر — پس انتخاب این مدل باید یک تصمیم آگاهانه باشد، نه پیشفرض. یک تذکر لازم هم اینکه این جدول عکسِ لحظهای تعرفههاست و تعرفهها تغییر میکنند؛ مرجع همیشگی، عدد بهروزِ هر مدل در کاتالوگ مدلهاست.
گرانترین مدل، «بهترین انتخاب» نیست؛ «بالاترین سقف» است. این دو وقتی یکی میشوند که مسئلهی شما واقعاً به آن سقف نیاز داشته باشد — و بیشتر کارهای روزمره ندارند.
پس چهوقت این مدل، چهوقت مدل دیگر؟
- سراغ Fable 5.1 بروید وقتی مسئله واقعاً سخت است: کدنویسی چندفایلی و طولانی، رفع باگی که مدلهای دیگر گیر کردهاند، تحلیل عمیق یک پروندهی بزرگ، یا کاری که ساعتها روی یک زمینهی ثابت ادامه پیدا میکند — همانجا که تخفیف حافظهی نهان بیشترین اثر را دارد.
- سراغ ردهی میانی بروید — مثل Claude Sonnet 5 یا GPT-5.6 Sol — برای کار حرفهای روزمره که به بالاترین سقف نیاز ندارد. حدود یکپنجم هزینه دارند.
- سراغ یک مدل سبک بروید برای ترجمه، خلاصه، دستهبندی و پاسخهای کوتاه. صرفهجویی واقعی از انتخاب ردهی درست میآید، نه از چانهزدن سر چند درصد.
لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدلها همان درخواست واقعی خودتان را همزمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.
پرسشهای متداول
تفاوتش با Fable 5 در عمل چقدر است؟
در همهی سنجههای منتشرشده بالاتر است و در دو مورد — پژوهش علمی و گردشکار اداری — تقریباً دو برابر. تعرفهی ورودی و خروجی هم تغییری نکرده، پس اگر روی Fable 5 چیزی ساختهاید، ارتقا تقریباً همیشه به سودتان است؛ در کارهای طولانی بهخاطر ارزانشدن حافظهی نهان، ارزانتر هم تمام میشود.
آیا از Opus 5 بهتر است؟
در جدول منتشرشده بله، در همهی ردیفها. اما Opus 5 حدود نصف قیمت دارد، پس پرسش درست این نیست که کدام بهتر است، بلکه این است که آن اختلاف چند درصدی برای کار شما ارزش دو برابر هزینه را دارد یا نه.
«پنج سطح تلاش» یعنی چه و کدام را انتخاب کنم؟
یعنی میتوانید تعیین کنید مدل چقدر برای پاسخ «فکر» کند. سطح بالاتر برای مسائل پیچیده و چندمرحلهای منطقی است؛ برای پرسشهای ساده فقط هزینه و زمان را بالا میبرد بدون اینکه جواب بهتری بدهد. اگر مطمئن نیستید، از سطح میانی شروع کنید و فقط وقتی بالا ببرید که جواب راضیتان نکرد.
حافظهی نهان را باید خودم روشن کنم؟
نه. این کار در سمت پلتفرم انجام میشود و لازم نیست تنظیمی بزنید. تنها کاری که از شما برمیآید این است که گفتوگو را ادامه بدهید بهجای اینکه برای هر پرسش گفتوگوی تازه باز کنید — چون صرفهجویی دقیقاً از همان تکرارِ زمینه میآید.
فارسی را خوب میفهمد؟
خانوادهی Claude جزو قویترینها در کار چندزبانه است و در نوشتنِ روان فارسی معمولاً نتیجهی خوبی میدهد، اما هیچ سنجهی عمومیای کیفیت فارسی را جداگانه اندازه نمیگیرد. توصیهی ما ساده است: یک نمونهی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.
چطور در هوشواره از آن استفاده کنم؟
مثل هر مدل دیگر: در صفحهی گفتوگو از فهرست مدلها انتخابش کنید. هزینهی هر پاسخ پیش و پس از ارسال بهصورت تومانی نمایش داده میشود — که در مورد این مدل بیش از همیشه ارزش نگاهکردن دارد. اگر توسعهدهندهاید، از طریق API هم در دسترس است.
جمعبندی
Claude Fable 5.1 یک بهروزرسانی بیسروصدا نیست: در سنجههای سازنده از نسل قبل و از رقبای مستقیمش جلو زده، در کارهای طولانی و چندمرحلهای بهتر شده، و بدون بالا بردن تعرفهی پایه، هزینهی واقعیِ کارهای ادامهدار را پایین آورده است.
در عین حال گرانترین گزینهی روی میز است و برای بخش بزرگی از کارهای روزمره اضافه است. بهترین کاری که میتوانید بکنید این است که آن را برای مسائل سختتان نگه دارید و بقیه را به ردههای پایینتر بسپارید. فهرست کامل مدلها و تعرفهی تومانی هرکدام در کاتالوگ مدلها و طرحهای اشتراک در صفحهی تعرفهها است. حساب ندارید؟ ثبتنام کمتر از یک دقیقه طول میکشد.