GPT-6 Astra: بررسی کامل، بنچمارک‌ها و چرا تعرفه‌ی گران لزوماً صورت‌حساب گران نیست

GPT-6 Astra: بررسی کامل، بنچمارک‌ها و چرا تعرفه‌ی گران لزوماً صورت‌حساب گران نیست

GPT-6 Astra جی‌پی‌تی OpenAI مدل زبانی بزرگ مقایسه مدل‌های هوش مصنوعی هزینه هوش مصنوعی بنچمارک هوش مصنوعی هوش مصنوعی عاملی

شرکت OpenAI نسل ششم را منتشر کرد: GPT-6 Astra، مدلی که سازنده‌اش آن را «هوشمندترین و هم‌راستاترین مدل جهان» می‌نامد. تعرفه‌ی هر توکنش دقیقاً برابر گران‌ترین رقیبش است، اما ادعای اصلی معرفی رسمی درباره‌ی قیمت نیست — درباره‌ی تعداد توکن است: سازنده می‌گوید همان کار را با توکن به‌مراتب کمتری تمام می‌کند و بنابراین هزینه‌ی هر کارِ تمام‌شده پایین‌تر درمی‌آید. در این مقاله می‌بینیم این ادعا در سنجه‌ها چقدر پشتوانه دارد، کجا برعکس عمل می‌کند، و یک نکته‌ی امنیتی که کاربران باید از پیش بدانند.

GPT-6 Astra دقیقاً چیست؟

تازه‌ترین و بالاترین رده‌ی خانواده‌ی GPT، یک مدل زبانی بزرگ از شرکت OpenAI. مشخصات کلیدی:

  • پنجره‌ی متن بیش از یک میلیون توکن؛ سازنده گزارش می‌کند در بازیابی اطلاعات از متن بلند تا مرز ۵۱۲ هزار توکن دقت کامل دارد و در بازه‌ی ۵۱۲ هزار تا یک میلیون هم بالای ۹۶ درصد می‌ماند.
  • تمرکز روی کار با کامپیوتر و مرورگر — پرکردن فرم، به‌روزرسانی سوابق در نرم‌افزارهای سازمانی، جست‌وجوی وب و کار مستقیم داخل نرم‌افزارهای تخصصی.
  • ساخت خروجی‌های اداری قابل‌استفاده: سند، صفحه‌گسترده و ارائه‌ای که قالب و لحن شما را دنبال می‌کند.
  • حالت پرسیدن به‌جای حدس‌زدن؛ وقتی دستور مبهم است، در مواردی که پاسخ نتیجه را عوض می‌کند سؤال می‌پرسد و در موارد کم‌اهمیت خودش فرض معقول می‌گذارد.

کارنامه‌ی بنچمارک‌ها

جدول زیر سنجه‌هایی است که در معرفی رسمی منتشر شد، همراه با رقبایی که خودِ سازنده انتخاب کرده. خانه‌های خالی یعنی آن مدل در آن ردیف گزارش نشده است.

سنجهGPT-6 AstraClaude Fable 5.1Claude Opus 5GPT-5.6 Sol
Terminal-Bench 4.0 — کدنویسی عاملی۵۷٫۹۵۵٫۸۳۷٫۳
Terminal-Bench Science — پژوهش علمی۶۴٫۶۵۲٫۶۲۲٫۴
Agents' Last Exam — کار حرفه‌ای واقعی۵۹٫۳۵۵٫۵۵۳٫۶
OSWorld 2.0 — کار با کامپیوتر۷۲٫۶۶۵٫۷
GPQA Diamond — علوم سطح دکتری۹۶٫۰۹۴٫۶
BenchCAD — مدل‌سازی سه‌بعدی۹۵٫۹۸۴٫۳۸۳٫۳
FrontierMath Tier 4 — ریاضیات مرزی۹۸
ARC-AGI-3 — حل محیط ناآشنا۹۹٫۹
SRE-Bench — مهندسی معکوس (تک‌تلاش)۸۸٫۰۵۵٫۹

در همه‌ی ردیف‌های گزارش‌شده بالاترین عدد را دارد و در چند مورد فاصله بزرگ است: پژوهش علمی عاملی ۶۴٫۶ در برابر ۵۲٫۶، و مهندسی معکوس نرم‌افزار ۸۸٫۰ در برابر ۵۵٫۹. دو ردیف آخرِ ریاضیات و حل محیط ناآشنا عملاً «اشباع» شده‌اند — یعنی سنجه دیگر توان تفکیک ندارد و باید سنجه‌ی سخت‌تری ساخته شود.

و همان تذکر همیشگی، که اینجا هم جا دارد: این اعداد را خودِ سازنده منتشر کرده و رقبای جدول را هم خودش انتخاب کرده است. یک نکته‌ی مثبت اما این‌جاست که ارقامی که برای رقیب گزارش شده با آنچه خودِ آن رقیب هفته‌ی پیش منتشر کرده بود هم‌خوان است — که نشانه‌ی خوبی برای صداقت جدول است، هرچند جایگزین آزمودن با کار خودتان نمی‌شود.

عددی که از رتبه مهم‌تر است: توکن کمتر برای همان کار

معرفی رسمی تقریباً کنار هر سنجه یک عدد دوم هم می‌آورد: هزینه‌ی تخمینی هر کار. و همان‌جاست که ادعای اصلی این انتشار قرار دارد — نه «ارزان‌تر است»، بلکه «کمتر حرف می‌زند»:

  • در سنجه‌ی کار حرفه‌ای، حدود ۶۵ درصد توکن خروجی کمتر از یکی از پرچم‌داران رقیب مصرف می‌کند و در عین حال امتیاز بالاتری می‌گیرد.
  • در کدنویسی عاملی، هزینه‌ی تخمینی هر کار حدود ۶۳ درصد کمتر از رقیب هم‌قیمتش برآورد شده — با وجود اینکه تعرفه‌ی هر توکن هر دو یکسان است.
  • در کار با کامپیوتر، همان کار را در حدود ۴۷ درصد زمان کمتر تمام می‌کند.

چرا این برای شما مهم است: صورت‌حساب شما حاصل‌ضرب تعرفه در تعداد توکن است. دو مدل با تعرفه‌ی کاملاً یکسان می‌توانند صورت‌حساب‌های خیلی متفاوتی بسازند، و تنها راه فهمیدنش اجرای یک کار واقعی است. جالب اینکه این دقیقاً برعکسِ چیزی است که در مدل تازه‌ی گوگل دیدیم: آنجا تعرفه ثابت بود و مصرف توکن بالا می‌رفت؛ اینجا تعرفه بالاست و مصرف توکن پایین می‌آید.

تعرفه، قیمتِ یک واحد است؛ صورت‌حساب، حاصل‌ضرب آن در تعداد واحدهاست. سازنده‌ها اولی را روی بنر می‌نویسند و دومی را شما در پایان ماه می‌بینید.

— تیم هوشواره

یک نکته‌ی امنیتی که بهتر است از پیش بدانید

سازنده اعلام کرده این مدل در حوزه‌ی امنیت سایبری به بالاترین سطح هشدارِ چارچوب ایمنی خودش رسیده است. در ارزیابی‌های داخلی — و به تصریح خودشان، در نسخه‌ای بدون محافظ‌های نهایی — توانایی چشمگیری در یافتن نقص‌های نرم‌افزاری نشان داده و حتی دو آسیب‌پذیری ناشناخته را پیدا کرده که به سازندگانشان گزارش شده است.

آنچه برای شما اهمیت عملی دارد، سمت دیگر ماجراست: نسخه‌ای که امروز در دسترس عموم است، درخواست‌های پیشرفته‌ی امنیتی را رد می‌کند. یعنی می‌توانید از آن برای بازبینی امن کد و وصله‌کردن نقص‌ها کمک بگیرید، اما اگر انتظار دارید برایتان کدِ سوءاستفاده بنویسد، پاسخ نه است. سازنده گفته دسترسی گسترده‌تر را بعداً و فقط برای مدافعان امنیتیِ تأییدشده باز می‌کند.

وقتی سازنده‌ای خودش می‌گوید مدل به «آستانه‌ی بحرانی» رسیده، این تبلیغ نیست — اطلاع‌رسانی است. و مهم‌ترین بخشش برای کاربر عادی این است که نسخه‌ی عمومی عمداً محدود شده؛ اگر جوابِ «نه» گرفتید، ایراد از شما یا از پنل نیست.

مقایسه‌ی هزینه

برای اینکه مقایسه معنادار باشد، هزینه‌ی GPT-6 Astra را برابر ۱ می‌گیریم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).

مدلشاخص ورودیشاخص خروجیشاخص حافظه‌ی نهانشاخص گفت‌وگوی معمول
GPT-6 Astra۱٫۰۱٫۰۱٫۰۱٫۰۰
Claude Fable 5.1۱٫۰۱٫۰۰٫۲۵۱٫۰۰
Claude Opus 5۰٫۵۰٫۵۰٫۵۰۰٫۵۰
GPT-5.6 Sol۰٫۲۰٫۲۰٫۲۰۰٫۲۰
GLM-5.3۰٫۱۴۰٫۰۹۰٫۲۶۰٫۱۱
Gemini 3.8 Flash۰٫۰۷۵۰٫۰۷۵۰٫۰۷۵۰٫۰۷۵
GLM-5.3 Flash۰٫۰۰۸۰٫۰۰۵۰٫۰۱۵۰٫۰۰۶

سه چیز را از این جدول بردارید. اول: این گران‌ترین رده‌ی موجود است، هم‌قیمتِ پرچم‌دار خانواده‌ی Claude و حدود سیزده برابرِ مدل کارِ روزمره‌ی گوگل. دوم و مهم‌تر: ستون حافظه‌ی نهان — هزینه‌ی «یادآوری» متنی که قبلاً فرستاده‌اید — در Astra چهار برابرِ رقیب هم‌قیمتش است. پس اگر کارتان گفت‌وگوی طولانی و ادامه‌دار روی یک زمینه‌ی ثابت است، برتری «توکن کمتر» تا حد زیادی خنثی می‌شود.

سوم: برای بخش بزرگی از کارهای روزمره، این رده اضافه است. یک تذکر لازم هم اینکه این جدول عکسِ لحظه‌ای تعرفه‌هاست و تعرفه‌ها تغییر می‌کنند؛ مرجع همیشگی، عدد به‌روزِ هر مدل در کاتالوگ مدل‌هاست.

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

  • سراغ GPT-6 Astra بروید وقتی مسئله واقعاً سخت است: کار با کامپیوتر و مرورگر، پژوهش علمی، مهندسی نرم‌افزار پیچیده، یا ساخت اسناد و ارائه‌هایی که باید قالب و لحن مشخصی را دنبال کنند. همچنین وقتی کار یک‌باره و سنگین است — چون آنجاست که «توکن کمتر» واقعاً به‌صرفه‌اش می‌کند.
  • سراغ رقیب هم‌قیمتش بروید اگر کارتان گفت‌وگوی بسیار طولانی روی یک زمینه‌ی ثابت است؛ ارزان‌تر بودنِ حافظه‌ی نهانش دقیقاً در همان الگو خودش را نشان می‌دهد.
  • سراغ رده‌ی میانی یا سبک بروید برای کار روزمره، ترجمه، خلاصه و پاسخ کوتاه — جایی که اختلاف هزینه ده‌ها برابر است و اختلاف کیفیت معمولاً حس نمی‌شود.

لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدل‌ها همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.

پرسش‌های متداول

واقعاً از Claude Fable 5.1 بهتر است؟

در جدولی که OpenAI منتشر کرده، در ردیف‌های مشترک بله. اما تعرفه‌ی هر توکنشان یکسان است و برتری واقعی به الگوی کار شما بستگی دارد: Astra در کارهای یک‌باره‌ی سنگین به‌خاطر مصرف توکن کمتر به‌صرفه‌تر است، و رقیبش در گفت‌وگوهای طولانیِ ادامه‌دار به‌خاطر حافظه‌ی نهان ارزان‌ترش. هر دو در کاتالوگ هستند و مقایسه‌ی واقعی یک اجرا بیشتر طول نمی‌کشد.

«اشباع‌شدن یک سنجه» یعنی چه؟

یعنی مدل آن‌قدر بالا امتیاز گرفته که آزمون دیگر نمی‌تواند مدل‌ها را از هم جدا کند — مثل امتحانی که همه ۲۰ می‌گیرند. این نشانه‌ی خوبی برای مدل است، ولی از آن به بعد آن سنجه دیگر برای انتخاب به درد نمی‌خورد و باید سراغ آزمون سخت‌تر رفت.

چرا با اینکه گران است می‌گویید ممکن است ارزان‌تر تمام شود؟

چون تعرفه فقط نصف معادله است. اگر مدلی همان کار را با نصف توکن تمام کند، با تعرفه‌ی دو برابر هم هزینه‌اش برابر درمی‌آید — و اگر کار را در یک بار درست انجام دهد به‌جای سه بار، ارزان‌تر هم می‌شود. این ادعای سازنده است و آزمودنش ساده: همان کار واقعی خودتان را یک‌بار با هر دو مدل اجرا کنید و رقم پایین صفحه را مقایسه کنید.

می‌توانم برای کارهای امنیتی از آن استفاده کنم؟

برای بازبینی کد و پیداکردن و وصله‌کردن نقص‌ها بله. برای ساختن نمونه‌ی سوءاستفاده، نه — نسخه‌ی عمومی این درخواست‌ها را رد می‌کند و این محدودیت عمدی است، نه ایراد.

فارسی را خوب می‌فهمد؟

خانواده‌ی GPT در کار چندزبانه قوی است، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود — که در مورد این رده بیش از همیشه ارزش نگاه‌کردن دارد. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

GPT-6 Astra یک جهش واقعی است: در هر ردیفی که سازنده گزارش کرده بالاترین عدد را دارد، دو سنجه‌ی سخت را اشباع کرده، و — مهم‌تر برای جیب شما — همان کار را با توکن کمتری تمام می‌کند. در عین حال گران‌ترین رده‌ی موجود است، حافظه‌ی نهانش از رقیب هم‌قیمتش گران‌تر است، و برای بیشتر کارهای روزمره اضافه است.

بهترین کار این است که آن را برای مسائل سختتان نگه دارید و بقیه را به رده‌های پایین‌تر بسپارید. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد.

مطالب دیگر