Claude Fable 5.1: بررسی کامل، بنچمارک‌ها و تغییری که در صورت‌حساب دیده می‌شود

Claude Fable 5.1: بررسی کامل، بنچمارک‌ها و تغییری که در صورت‌حساب دیده می‌شود

Claude Fable 5.1 کلاد مدل زبانی بزرگ مقایسه مدل‌های هوش مصنوعی هزینه هوش مصنوعی بنچمارک هوش مصنوعی حافظه نهان هوش مصنوعی عاملی

خانواده‌ی Claude نسخه‌ی تازه‌ی پرچم‌دارش را منتشر کرد: Claude Fable 5.1. نکته‌ی غیرمعمول این انتشار این است که تعرفه‌ی ورودی و خروجی‌اش دقیقاً همان نسل قبل است — اما در سنجه‌های منتشرشده از نسل قبل و از رقبا جلو می‌زند، و یک تغییر قیمتی دارد که در جدول اصلی دیده نمی‌شود ولی در صورت‌حساب ماهانه‌ی شما دیده می‌شود. در این مقاله سه چیز را جدا از هم می‌بینیم: چه چیزی عوض شده، در سنجه‌ها کجا ایستاده، و آن تغییر پنهانِ هزینه دقیقاً برای چه کسانی معنا دارد.

Claude Fable 5.1 دقیقاً چیست؟

یک مدل زبانی بزرگ از شرکت Anthropic و بالاترین رده‌ی خانواده‌ی Claude. نسخه‌ی ۵٫۱ یک به‌روزرسانی روی Fable 5 است، نه یک معماری تازه. مشخصات کلیدی:

  • پنجره‌ی متن یک میلیون توکن — چیزی در حدود هفتصد و پنجاه هزار کلمه در یک گفت‌وگو.
  • پنج سطح تلاش: کم، متوسط، زیاد، خیلی‌زیاد و بیشینه. هرچه بالاتر، پاسخ دقیق‌تر و کندتر و پرهزینه‌تر؛ انتخاب درستِ این سطح یکی از مؤثرترین کارهایی است که می‌توانید برای کنترل هزینه بکنید.
  • تمرکز بر کارهای طولانی و چندمرحله‌ای — سازنده می‌گوید مدل در کارهای طولانی «خوانا» می‌ماند، یعنی هرچه بیشتر کار می‌کند دنبال‌کردن کارش سخت‌تر نمی‌شود؛ همان چیزی که در نسل‌های قبل شکایت رایجی بود.
  • ورودی متن و تصویر، و توانایی کار با محیط کامپیوتر و مرورگر.

سازنده هم‌زمان مدل دیگری به نام Mythos 5.1 معرفی کرده که به گفته‌ی خودش همان مدل است با سطح متفاوتی از محافظ‌های ایمنی، و دسترسی به آن محدود به برنامه‌های تأییدشده‌ی تخصصی است. آنچه در دسترس عموم — و در هوشواره — قرار دارد، Fable 5.1 است.

کارنامه‌ی بنچمارک‌ها

جدول زیر سنجه‌هایی است که در معرفی رسمی منتشر شد. عددهای بزرگ‌تر بهترند.

سنجهFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench 4.0 — کدنویسی عاملی۵۵٫۸۴۲٫۰۵۲٫۳۳۷٫۳
Terminal-Bench-Science — پژوهش علمی۵۲٫۶۲۴٫۷۲۹٫۰۲۲٫۴
CursorBench 3.2 — کدنویسی در ویرایشگر۷۳٫۴۷۰٫۵۷۰٫۰۶۷٫۲
AutomationBench — گردش‌کار اداری۳۱٫۴۱۷٫۱۲۶٫۹۱۹٫۶
GDPval-AA v2 — کار دانشی۱۸۵۳۱۷۲۳۱۸۲۴۱۷۱۱
OSWorld 2.0 — کار با کامپیوتر (جزئی)۷۷٫۹۷۲٫۹۷۵٫۴
OSWorld 2.0 — کار با کامپیوتر (کامل)۴۱٫۷۳۶٫۱۳۹٫۶
HLE — بدون ابزار۶۰٫۹۵۷٫۸۵۶٫۶
HLE — با ابزار۶۵٫۰۶۳٫۸۶۳٫۶

خواندن این جدول ساده است، چون تصویرش برخلاف بیشتر انتشارها یکدست است: در هر نُه ردیف، Fable 5.1 بالاترین عدد را دارد. در چند مورد فاصله با نسل قبل بزرگ است — پژوهش علمی عاملی بیش از دو برابر شده (۲۴٫۷ به ۵۲٫۶) و گردش‌کار اداری تقریباً دو برابر (۱۷٫۱ به ۳۱٫۴).

اما یک تذکر لازم که در هیچ معرفی رسمی‌ای نمی‌آید: این اعداد را خودِ سازنده منتشر کرده، با ابزار و تنظیمات خودش. جدولی که در آن یک مدل همه‌ی ردیف‌ها را می‌برد، دقیقاً همان جدولی است که باید با احتیاط بیشتری خوانده شود — نه به این معنا که غلط است، بلکه به این معنا که تنها آزمون معتبر برای شما، کار واقعی خودتان است.

وقتی یک مدل در همه‌ی ردیف‌های جدولِ سازنده‌اش اول می‌شود، چیزی که یاد گرفته‌اید این است که سازنده کدام ردیف‌ها را برای انتشار انتخاب کرده — نه اینکه مدل در کار شما هم اول می‌شود.

— تیم هوشواره

تغییری که در جدول قیمت دیده نمی‌شود

تعرفه‌ی ورودی و خروجی Fable 5.1 دقیقاً برابر Fable 5 است. اما یک عدد سوم هم هست که کمتر کسی نگاهش می‌کند و این‌بار یک‌چهارم شده: هزینه‌ی خواندن از حافظه‌ی نهان.

توضیح ساده‌اش این است: وقتی در یک گفت‌وگو بارها همان متن اولیه را می‌فرستید — یک سند بلند، یک پرونده‌ی کد، دستورالعمل‌های ثابت — مدل لازم نیست هر بار از صفر آن را بخواند. بخش تکراری در حافظه‌ی نهان می‌ماند و دفعات بعد با تعرفه‌ی به‌مراتب ارزان‌تری حساب می‌شود. در Fable 5 آن تعرفه یک‌دهمِ ورودی عادی بود؛ در Fable 5.1 به یک‌چهلم رسیده است.

چرا این برای شما مهم است: در هوشواره آنچه از کیف پول شما کم می‌شود بر پایه‌ی هزینه‌ی واقعیِ همان درخواست محاسبه می‌شود، پس هر صرفه‌جویی‌ای که در بالادست اتفاق بیفتد مستقیم به صورت‌حساب شما می‌رسد — نه اینکه جایی وسط راه بماند. سازنده تخمین می‌زند این تغییر هزینه‌ی کارهای معمول را حدود یک‌چهارم و کارهای عاملیِ سنگین را تا حدود ۴۵ درصد پایین می‌آورد.

و یک نکته‌ی صادقانه در کنارش: این صرفه‌جویی فقط وقتی اتفاق می‌افتد که گفت‌وگو ادامه‌دار باشد. اگر هر بار یک پرسش کوتاهِ تازه می‌پرسید، چیزی برای دوباره‌خواندن وجود ندارد و این تخفیف عملاً به شما نمی‌رسد. بیشترین سود را کسی می‌برد که ساعت‌ها روی یک پرونده‌ی کد یا یک سند بلند کار می‌کند.

مقایسه‌ی هزینه

برای اینکه مقایسه معنادار باشد، به‌جای عدد مطلق از شاخص نسبی استفاده می‌کنیم: هزینه‌ی Fable 5.1 را برابر ۱ می‌گیریم و بقیه را نسبت به آن می‌سنجیم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).

مدلورودیخروجیخواندن از حافظه‌ی نهانگفت‌وگوی معمول
Claude Fable 5.1۱٫۰۱٫۰۱٫۰۱٫۰۰
Claude Fable 5 (نسل قبل)۱٫۰۱٫۰۴٫۰۱٫۰۰
Claude Opus 5۰٫۵۰٫۵۲٫۰۰٫۵۰
Claude Sonnet 5۰٫۲۰٫۲۰٫۸۰٫۲۰
GPT-5.6 Sol۰٫۲۰٫۲۰٫۸۰٫۲۰
GLM-5.3۰٫۱۴۰٫۰۹۱٫۰۴۰٫۱۱
GLM-5.3 Flash۰٫۰۰۸۰٫۰۰۵۰٫۰۶۰٫۰۱

دو ردیف اول تمام حرفِ این انتشار است: ورودی و خروجی یکسان، اما ستون حافظه‌ی نهان چهار برابر. یعنی برای کار کوتاه، Fable 5.1 و نسل قبلش هزینه‌ی یکسانی دارند و انتخاب بدیهی است؛ برای کار طولانی، نسل قبل به‌مراتب گران‌تر تمام می‌شود.

بقیه‌ی جدول هم تصویر روشنی می‌دهد: این گران‌ترین رده‌ای است که می‌توانید انتخاب کنید. یک مدل سبک مثل GLM-5.3 Flash برای همان گفت‌وگو حدود یک‌صدم خرج برمی‌دارد. تفاوت کیفیت در سنجه‌ها معمولاً چند درصد است و تفاوت هزینه چند ده برابر — پس انتخاب این مدل باید یک تصمیم آگاهانه باشد، نه پیش‌فرض. یک تذکر لازم هم اینکه این جدول عکسِ لحظه‌ای تعرفه‌هاست و تعرفه‌ها تغییر می‌کنند؛ مرجع همیشگی، عدد به‌روزِ هر مدل در کاتالوگ مدل‌هاست.

گران‌ترین مدل، «بهترین انتخاب» نیست؛ «بالاترین سقف» است. این دو وقتی یکی می‌شوند که مسئله‌ی شما واقعاً به آن سقف نیاز داشته باشد — و بیشتر کارهای روزمره ندارند.

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

  • سراغ Fable 5.1 بروید وقتی مسئله واقعاً سخت است: کدنویسی چندفایلی و طولانی، رفع باگی که مدل‌های دیگر گیر کرده‌اند، تحلیل عمیق یک پرونده‌ی بزرگ، یا کاری که ساعت‌ها روی یک زمینه‌ی ثابت ادامه پیدا می‌کند — همان‌جا که تخفیف حافظه‌ی نهان بیشترین اثر را دارد.
  • سراغ رده‌ی میانی بروید — مثل Claude Sonnet 5 یا GPT-5.6 Sol — برای کار حرفه‌ای روزمره که به بالاترین سقف نیاز ندارد. حدود یک‌پنجم هزینه دارند.
  • سراغ یک مدل سبک بروید برای ترجمه، خلاصه، دسته‌بندی و پاسخ‌های کوتاه. صرفه‌جویی واقعی از انتخاب رده‌ی درست می‌آید، نه از چانه‌زدن سر چند درصد.

لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدل‌ها همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.

پرسش‌های متداول

تفاوتش با Fable 5 در عمل چقدر است؟

در همه‌ی سنجه‌های منتشرشده بالاتر است و در دو مورد — پژوهش علمی و گردش‌کار اداری — تقریباً دو برابر. تعرفه‌ی ورودی و خروجی هم تغییری نکرده، پس اگر روی Fable 5 چیزی ساخته‌اید، ارتقا تقریباً همیشه به سودتان است؛ در کارهای طولانی به‌خاطر ارزان‌شدن حافظه‌ی نهان، ارزان‌تر هم تمام می‌شود.

آیا از Opus 5 بهتر است؟

در جدول منتشرشده بله، در همه‌ی ردیف‌ها. اما Opus 5 حدود نصف قیمت دارد، پس پرسش درست این نیست که کدام بهتر است، بلکه این است که آن اختلاف چند درصدی برای کار شما ارزش دو برابر هزینه را دارد یا نه.

«پنج سطح تلاش» یعنی چه و کدام را انتخاب کنم؟

یعنی می‌توانید تعیین کنید مدل چقدر برای پاسخ «فکر» کند. سطح بالاتر برای مسائل پیچیده و چندمرحله‌ای منطقی است؛ برای پرسش‌های ساده فقط هزینه و زمان را بالا می‌برد بدون اینکه جواب بهتری بدهد. اگر مطمئن نیستید، از سطح میانی شروع کنید و فقط وقتی بالا ببرید که جواب راضی‌تان نکرد.

حافظه‌ی نهان را باید خودم روشن کنم؟

نه. این کار در سمت پلتفرم انجام می‌شود و لازم نیست تنظیمی بزنید. تنها کاری که از شما برمی‌آید این است که گفت‌وگو را ادامه بدهید به‌جای اینکه برای هر پرسش گفت‌وگوی تازه باز کنید — چون صرفه‌جویی دقیقاً از همان تکرارِ زمینه می‌آید.

فارسی را خوب می‌فهمد؟

خانواده‌ی Claude جزو قوی‌ترین‌ها در کار چندزبانه است و در نوشتنِ روان فارسی معمولاً نتیجه‌ی خوبی می‌دهد، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود — که در مورد این مدل بیش از همیشه ارزش نگاه‌کردن دارد. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

Claude Fable 5.1 یک به‌روزرسانی بی‌سروصدا نیست: در سنجه‌های سازنده از نسل قبل و از رقبای مستقیمش جلو زده، در کارهای طولانی و چندمرحله‌ای بهتر شده، و بدون بالا بردن تعرفه‌ی پایه، هزینه‌ی واقعیِ کارهای ادامه‌دار را پایین آورده است.

در عین حال گران‌ترین گزینه‌ی روی میز است و برای بخش بزرگی از کارهای روزمره اضافه است. بهترین کاری که می‌توانید بکنید این است که آن را برای مسائل سختتان نگه دارید و بقیه را به رده‌های پایین‌تر بسپارید. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد.

مطالب دیگر