GPT-6 Astra: بررسی کامل، بنچمارکها و چرا تعرفهی گران لزوماً صورتحساب گران نیست
شرکت OpenAI نسل ششم را منتشر کرد: GPT-6 Astra، مدلی که سازندهاش آن را «هوشمندترین و همراستاترین مدل جهان» مینامد. تعرفهی هر توکنش دقیقاً برابر گرانترین رقیبش است، اما ادعای اصلی معرفی رسمی دربارهی قیمت نیست — دربارهی تعداد توکن است: سازنده میگوید همان کار را با توکن بهمراتب کمتری تمام میکند و بنابراین هزینهی هر کارِ تمامشده پایینتر درمیآید. در این مقاله میبینیم این ادعا در سنجهها چقدر پشتوانه دارد، کجا برعکس عمل میکند، و یک نکتهی امنیتی که کاربران باید از پیش بدانند.
GPT-6 Astra دقیقاً چیست؟
تازهترین و بالاترین ردهی خانوادهی GPT، یک مدل زبانی بزرگ از شرکت OpenAI. مشخصات کلیدی:
- پنجرهی متن بیش از یک میلیون توکن؛ سازنده گزارش میکند در بازیابی اطلاعات از متن بلند تا مرز ۵۱۲ هزار توکن دقت کامل دارد و در بازهی ۵۱۲ هزار تا یک میلیون هم بالای ۹۶ درصد میماند.
- تمرکز روی کار با کامپیوتر و مرورگر — پرکردن فرم، بهروزرسانی سوابق در نرمافزارهای سازمانی، جستوجوی وب و کار مستقیم داخل نرمافزارهای تخصصی.
- ساخت خروجیهای اداری قابلاستفاده: سند، صفحهگسترده و ارائهای که قالب و لحن شما را دنبال میکند.
- حالت پرسیدن بهجای حدسزدن؛ وقتی دستور مبهم است، در مواردی که پاسخ نتیجه را عوض میکند سؤال میپرسد و در موارد کماهمیت خودش فرض معقول میگذارد.
کارنامهی بنچمارکها
جدول زیر سنجههایی است که در معرفی رسمی منتشر شد، همراه با رقبایی که خودِ سازنده انتخاب کرده. خانههای خالی یعنی آن مدل در آن ردیف گزارش نشده است.
| سنجه | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 — کدنویسی عاملی | ۵۷٫۹ | ۵۵٫۸ | — | ۳۷٫۳ |
| Terminal-Bench Science — پژوهش علمی | ۶۴٫۶ | ۵۲٫۶ | — | ۲۲٫۴ |
| Agents' Last Exam — کار حرفهای واقعی | ۵۹٫۳ | — | ۵۵٫۵ | ۵۳٫۶ |
| OSWorld 2.0 — کار با کامپیوتر | ۷۲٫۶ | — | — | ۶۵٫۷ |
| GPQA Diamond — علوم سطح دکتری | ۹۶٫۰ | — | — | ۹۴٫۶ |
| BenchCAD — مدلسازی سهبعدی | ۹۵٫۹ | ۸۴٫۳ | — | ۸۳٫۳ |
| FrontierMath Tier 4 — ریاضیات مرزی | ۹۸ | — | — | — |
| ARC-AGI-3 — حل محیط ناآشنا | ۹۹٫۹ | — | — | — |
| SRE-Bench — مهندسی معکوس (تکتلاش) | ۸۸٫۰ | — | — | ۵۵٫۹ |
در همهی ردیفهای گزارششده بالاترین عدد را دارد و در چند مورد فاصله بزرگ است: پژوهش علمی عاملی ۶۴٫۶ در برابر ۵۲٫۶، و مهندسی معکوس نرمافزار ۸۸٫۰ در برابر ۵۵٫۹. دو ردیف آخرِ ریاضیات و حل محیط ناآشنا عملاً «اشباع» شدهاند — یعنی سنجه دیگر توان تفکیک ندارد و باید سنجهی سختتری ساخته شود.
و همان تذکر همیشگی، که اینجا هم جا دارد: این اعداد را خودِ سازنده منتشر کرده و رقبای جدول را هم خودش انتخاب کرده است. یک نکتهی مثبت اما اینجاست که ارقامی که برای رقیب گزارش شده با آنچه خودِ آن رقیب هفتهی پیش منتشر کرده بود همخوان است — که نشانهی خوبی برای صداقت جدول است، هرچند جایگزین آزمودن با کار خودتان نمیشود.
عددی که از رتبه مهمتر است: توکن کمتر برای همان کار
معرفی رسمی تقریباً کنار هر سنجه یک عدد دوم هم میآورد: هزینهی تخمینی هر کار. و همانجاست که ادعای اصلی این انتشار قرار دارد — نه «ارزانتر است»، بلکه «کمتر حرف میزند»:
- در سنجهی کار حرفهای، حدود ۶۵ درصد توکن خروجی کمتر از یکی از پرچمداران رقیب مصرف میکند و در عین حال امتیاز بالاتری میگیرد.
- در کدنویسی عاملی، هزینهی تخمینی هر کار حدود ۶۳ درصد کمتر از رقیب همقیمتش برآورد شده — با وجود اینکه تعرفهی هر توکن هر دو یکسان است.
- در کار با کامپیوتر، همان کار را در حدود ۴۷ درصد زمان کمتر تمام میکند.
چرا این برای شما مهم است: صورتحساب شما حاصلضرب تعرفه در تعداد توکن است. دو مدل با تعرفهی کاملاً یکسان میتوانند صورتحسابهای خیلی متفاوتی بسازند، و تنها راه فهمیدنش اجرای یک کار واقعی است. جالب اینکه این دقیقاً برعکسِ چیزی است که در مدل تازهی گوگل دیدیم: آنجا تعرفه ثابت بود و مصرف توکن بالا میرفت؛ اینجا تعرفه بالاست و مصرف توکن پایین میآید.
تعرفه، قیمتِ یک واحد است؛ صورتحساب، حاصلضرب آن در تعداد واحدهاست. سازندهها اولی را روی بنر مینویسند و دومی را شما در پایان ماه میبینید.
— تیم هوشواره
یک نکتهی امنیتی که بهتر است از پیش بدانید
سازنده اعلام کرده این مدل در حوزهی امنیت سایبری به بالاترین سطح هشدارِ چارچوب ایمنی خودش رسیده است. در ارزیابیهای داخلی — و به تصریح خودشان، در نسخهای بدون محافظهای نهایی — توانایی چشمگیری در یافتن نقصهای نرمافزاری نشان داده و حتی دو آسیبپذیری ناشناخته را پیدا کرده که به سازندگانشان گزارش شده است.
آنچه برای شما اهمیت عملی دارد، سمت دیگر ماجراست: نسخهای که امروز در دسترس عموم است، درخواستهای پیشرفتهی امنیتی را رد میکند. یعنی میتوانید از آن برای بازبینی امن کد و وصلهکردن نقصها کمک بگیرید، اما اگر انتظار دارید برایتان کدِ سوءاستفاده بنویسد، پاسخ نه است. سازنده گفته دسترسی گستردهتر را بعداً و فقط برای مدافعان امنیتیِ تأییدشده باز میکند.
وقتی سازندهای خودش میگوید مدل به «آستانهی بحرانی» رسیده، این تبلیغ نیست — اطلاعرسانی است. و مهمترین بخشش برای کاربر عادی این است که نسخهی عمومی عمداً محدود شده؛ اگر جوابِ «نه» گرفتید، ایراد از شما یا از پنل نیست.
مقایسهی هزینه
برای اینکه مقایسه معنادار باشد، هزینهی GPT-6 Astra را برابر ۱ میگیریم. ستون آخر یک ترکیب واقعگرایانه از گفتوگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).
| مدل | شاخص ورودی | شاخص خروجی | شاخص حافظهی نهان | شاخص گفتوگوی معمول |
|---|---|---|---|---|
| GPT-6 Astra | ۱٫۰ | ۱٫۰ | ۱٫۰ | ۱٫۰۰ |
| Claude Fable 5.1 | ۱٫۰ | ۱٫۰ | ۰٫۲۵ | ۱٫۰۰ |
| Claude Opus 5 | ۰٫۵ | ۰٫۵ | ۰٫۵۰ | ۰٫۵۰ |
| GPT-5.6 Sol | ۰٫۲ | ۰٫۲ | ۰٫۲۰ | ۰٫۲۰ |
| GLM-5.3 | ۰٫۱۴ | ۰٫۰۹ | ۰٫۲۶ | ۰٫۱۱ |
| Gemini 3.8 Flash | ۰٫۰۷۵ | ۰٫۰۷۵ | ۰٫۰۷۵ | ۰٫۰۷۵ |
| GLM-5.3 Flash | ۰٫۰۰۸ | ۰٫۰۰۵ | ۰٫۰۱۵ | ۰٫۰۰۶ |
سه چیز را از این جدول بردارید. اول: این گرانترین ردهی موجود است، همقیمتِ پرچمدار خانوادهی Claude و حدود سیزده برابرِ مدل کارِ روزمرهی گوگل. دوم و مهمتر: ستون حافظهی نهان — هزینهی «یادآوری» متنی که قبلاً فرستادهاید — در Astra چهار برابرِ رقیب همقیمتش است. پس اگر کارتان گفتوگوی طولانی و ادامهدار روی یک زمینهی ثابت است، برتری «توکن کمتر» تا حد زیادی خنثی میشود.
سوم: برای بخش بزرگی از کارهای روزمره، این رده اضافه است. یک تذکر لازم هم اینکه این جدول عکسِ لحظهای تعرفههاست و تعرفهها تغییر میکنند؛ مرجع همیشگی، عدد بهروزِ هر مدل در کاتالوگ مدلهاست.
پس چهوقت این مدل، چهوقت مدل دیگر؟
- سراغ GPT-6 Astra بروید وقتی مسئله واقعاً سخت است: کار با کامپیوتر و مرورگر، پژوهش علمی، مهندسی نرمافزار پیچیده، یا ساخت اسناد و ارائههایی که باید قالب و لحن مشخصی را دنبال کنند. همچنین وقتی کار یکباره و سنگین است — چون آنجاست که «توکن کمتر» واقعاً بهصرفهاش میکند.
- سراغ رقیب همقیمتش بروید اگر کارتان گفتوگوی بسیار طولانی روی یک زمینهی ثابت است؛ ارزانتر بودنِ حافظهی نهانش دقیقاً در همان الگو خودش را نشان میدهد.
- سراغ ردهی میانی یا سبک بروید برای کار روزمره، ترجمه، خلاصه و پاسخ کوتاه — جایی که اختلاف هزینه دهها برابر است و اختلاف کیفیت معمولاً حس نمیشود.
لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدلها همان درخواست واقعی خودتان را همزمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.
پرسشهای متداول
واقعاً از Claude Fable 5.1 بهتر است؟
در جدولی که OpenAI منتشر کرده، در ردیفهای مشترک بله. اما تعرفهی هر توکنشان یکسان است و برتری واقعی به الگوی کار شما بستگی دارد: Astra در کارهای یکبارهی سنگین بهخاطر مصرف توکن کمتر بهصرفهتر است، و رقیبش در گفتوگوهای طولانیِ ادامهدار بهخاطر حافظهی نهان ارزانترش. هر دو در کاتالوگ هستند و مقایسهی واقعی یک اجرا بیشتر طول نمیکشد.
«اشباعشدن یک سنجه» یعنی چه؟
یعنی مدل آنقدر بالا امتیاز گرفته که آزمون دیگر نمیتواند مدلها را از هم جدا کند — مثل امتحانی که همه ۲۰ میگیرند. این نشانهی خوبی برای مدل است، ولی از آن به بعد آن سنجه دیگر برای انتخاب به درد نمیخورد و باید سراغ آزمون سختتر رفت.
چرا با اینکه گران است میگویید ممکن است ارزانتر تمام شود؟
چون تعرفه فقط نصف معادله است. اگر مدلی همان کار را با نصف توکن تمام کند، با تعرفهی دو برابر هم هزینهاش برابر درمیآید — و اگر کار را در یک بار درست انجام دهد بهجای سه بار، ارزانتر هم میشود. این ادعای سازنده است و آزمودنش ساده: همان کار واقعی خودتان را یکبار با هر دو مدل اجرا کنید و رقم پایین صفحه را مقایسه کنید.
میتوانم برای کارهای امنیتی از آن استفاده کنم؟
برای بازبینی کد و پیداکردن و وصلهکردن نقصها بله. برای ساختن نمونهی سوءاستفاده، نه — نسخهی عمومی این درخواستها را رد میکند و این محدودیت عمدی است، نه ایراد.
فارسی را خوب میفهمد؟
خانوادهی GPT در کار چندزبانه قوی است، اما هیچ سنجهی عمومیای کیفیت فارسی را جداگانه اندازه نمیگیرد. توصیهی ما ساده است: یک نمونهی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.
چطور در هوشواره از آن استفاده کنم؟
مثل هر مدل دیگر: در صفحهی گفتوگو از فهرست مدلها انتخابش کنید. هزینهی هر پاسخ پیش و پس از ارسال بهصورت تومانی نمایش داده میشود — که در مورد این رده بیش از همیشه ارزش نگاهکردن دارد. اگر توسعهدهندهاید، از طریق API هم در دسترس است.
جمعبندی
GPT-6 Astra یک جهش واقعی است: در هر ردیفی که سازنده گزارش کرده بالاترین عدد را دارد، دو سنجهی سخت را اشباع کرده، و — مهمتر برای جیب شما — همان کار را با توکن کمتری تمام میکند. در عین حال گرانترین ردهی موجود است، حافظهی نهانش از رقیب همقیمتش گرانتر است، و برای بیشتر کارهای روزمره اضافه است.
بهترین کار این است که آن را برای مسائل سختتان نگه دارید و بقیه را به ردههای پایینتر بسپارید. فهرست کامل مدلها و تعرفهی تومانی هرکدام در کاتالوگ مدلها و طرحهای اشتراک در صفحهی تعرفهها است. حساب ندارید؟ ثبتنام کمتر از یک دقیقه طول میکشد.