GPT-6.1 Sol: وقتی سازنده پرچم‌دار گران خودش را یک‌پنجم قیمت می‌کند

GPT-6.1 Sol: وقتی سازنده پرچم‌دار گران خودش را یک‌پنجم قیمت می‌کند

GPT-6.1 Sol جی‌پی‌تی OpenAI مدل زبانی بزرگ مقایسه مدل‌های هوش مصنوعی هزینه هوش مصنوعی بنچمارک هوش مصنوعی کدنویسی با هوش مصنوعی هوش مصنوعی عاملی

OpenAI در بیست‌وشش روز سه مدل منتشر کرده، و تازه‌ترینشان کار عجیبی می‌کند: GPT-6.1 Sol به پرچم‌دار گران‌ترِ همین شرکت می‌رسد و یک‌پنجم آن قیمت دارد. یعنی سازنده عملاً محصول گران خودش را بی‌اثر کرده است. در این مقاله می‌بینیم این ادعا چقدر پشتوانه دارد، تفاوتش با نسخه‌ای که فقط یک هفته قبل آمده بود چیست، و برای چه کسی واقعاً صرف می‌کند.

GPT-6.1 Sol دقیقاً چیست؟

رده‌ی «Sol» در خانواده‌ی GPT یعنی مدلِ کارِ حرفه‌ایِ روزمره — نه بزرگ‌ترین مدل ممکن، بلکه آنکه قرار است بار اصلی کار را ببرد. این نسخه یک مدل زبانی بزرگ از شرکت OpenAI است. مشخصات کلیدی:

  • پنجره‌ی متن بیش از یک میلیون توکن و خروجی تا ۱۲۸ هزار توکن در یک پاسخ.
  • سطوح تلاش قابل تنظیم؛ سازنده بیشتر نتایجش را در سطوح متوسط تا بیشینه گزارش کرده است.
  • تمرکز بر کار عاملی و کدنویسی — همان دسته‌ای که بیشترین جهش را داشته.
  • حافظه‌ی نهانِ بسیار ارزان: هزینه‌ی «یادآوری» متن تکراری یک‌بیستمِ ورودی عادی است، یعنی نسبت به نسخه‌ی هفته‌ی قبل نصف شده.

نکته‌ای که در فهرست بالا گم می‌شود ولی مهم است: نسخه‌ی قبلی این مدل فقط یک هفته زودتر منتشر شده بود. اگر روی آن چیزی ساخته‌اید، این ارتقا تقریباً بدون هزینه است — تعرفه‌ی ورودی و خروجی هر دو یکسان است.

کارنامه‌ی بنچمارک‌ها

جدول زیر ارقامی است که در معرفی رسمی منتشر شد. ستون سوم نسخه‌ی یک هفته پیش است، ستون چهارم پرچم‌دار گران‌ترِ همین شرکت، و ستون آخر رقیب مستقیم. عددهای بزرگ‌تر بهترند.

سنجهGPT-6.1 SolGPT-6 SolGPT-6 AstraClaude Opus 5.5
DeepSWE v1.1 — مهندسی نرم‌افزار۷۵٫۲۶۸٫۸۷۴٫۸—
OSWorld 2.0 — کار با کامپیوتر۷۱٫۴۶۴٫۴۷۳٫۵۶۰٫۳
GDP.pdf — پرسش از اسناد پیچیده۳۲٫۰۲۸٫۰۳۲٫۲۲۸٫۸
AutomationBench — گردش‌کار اداری۳۶٫۰۳۲٫۲—۳۳٫۸

خواندنش ساده است. در مهندسی نرم‌افزار و پرسش از اسناد، عملاً به پرچم‌دار رسیده — ۷۵٫۲ در برابر ۷۴٫۸ و ۳۲٫۰ در برابر ۳۲٫۲، یعنی اختلاف در حد خطای اندازه‌گیری. در کار با کامپیوتر هنوز حدود دو واحد عقب است. و در خودکارسازی اداری از رقیب مستقیمش هم جلو می‌زند.

سازنده چند ادعای هزینه‌ای هم کنار این اعداد گذاشته: همان دقتِ مهندسی نرم‌افزار با حدود هشتاد درصد هزینه‌ی کمتر از پرچم‌دار، و در کار با کامپیوتر حدود یک‌هفتم هزینه به ازای هر کارِ تمام‌شده. یک بهبود کم‌سروصدا هم گزارش شده که به کار روزمره می‌آید: در پایین‌ترین سطح تلاش، خطاهای واقعیت‌گویی حدود یک‌سوم کم شده است.

و همان تذکر همیشگی: این اعداد را خودِ سازنده منتشر کرده و رقبای جدول را هم خودش انتخاب کرده است. همان‌طور که در معرفی Opus 5.5 دیدیم، یکی از سازنده‌ها خودش نوشته که در این سطح، فاصله‌ی چنددهمی دیگر راهنمای قابل‌اتکایی نیست.

وقتی دو مدل ۷۵٫۲ و ۷۴٫۸ می‌گیرند، آن چهاردهم واحد چیزی درباره‌ی کار شما نمی‌گوید. چیزی که می‌گوید، ستون قیمت کنارش است.

— تیم هوشواره

وقتی سازنده محصول گران خودش را بی‌اثر می‌کند

غیرعادی‌ترین بخش این انتشار، اقتصاد آن است نه فناوری‌اش. پرچم‌دار همین شرکت کمتر از یک ماه پیش معرفی شد و حالا مدلی آمده که در بیشتر ردیف‌ها به آن می‌رسد و یک‌پنجم قیمت دارد. این اتفاق دو معنا دارد:

  • برای شما خبر خوبی است. کاری که تا ماه پیش فقط با گران‌ترین رده شدنی بود، حالا با یک‌پنجم هزینه انجام می‌شود.
  • برای انتخاب مدل یعنی عجله نکنید. رده‌ی بالای بازار در حال ارزان‌شدن سریع است؛ تعهد بلندمدت به یک مدل گران، ریسکش بیشتر از قبل شده.

مقایسه‌ی هزینه

برای اینکه مقایسه معنادار باشد، هزینه‌ی GPT-6.1 Sol را برابر ۱ می‌گیریم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).

مدلشاخص ورودیشاخص خروجیشاخص حافظه‌ی نهانشاخص گفت‌وگوی معمول
GPT-6.1 Sol۱٫۰۱٫۰۱٫۰۱٫۰۰
GPT-6 Sol (نسل قبل)۱٫۰۱٫۰۲٫۰۱٫۰۰
Claude Opus 5.5۲٫۰۲٫۰۲٫۰۲٫۰۰
GPT-6 Astra۵٫۰۵٫۰۱۰٫۰۵٫۰۰
Claude Fable 5.1۵٫۰۵٫۰۲٫۵۵٫۰۰
GLM-5.3۰٫۷۰۰٫۴۴۲٫۶۰٫۵۷
Gemini 3.8 Flash۰٫۳۸۰٫۳۸۰٫۷۵۰٫۳۸
GPT-6 Luna۰٫۰۵۰٫۰۵۰٫۱۰۰٫۰۵
DeepSeek V4.1 Flash۰٫۰۱۰٫۰۴۰٫۰۳۰٫۰۳

سه نکته از این جدول. اول: پرچم‌داران — چه از همین سازنده و چه رقیب — پنج برابر خرج برمی‌دارند، در حالی که جدول بالا نشان داد اختلافشان در حد چنددهم واحد است. دوم: نسبت به نسخه‌ی هفته‌ی پیش، تعرفه‌ی ورودی و خروجی تغییری نکرده و فقط حافظه‌ی نهان نصف شده؛ پس ارتقا از آن نسخه چیزی به صورت‌حساب شما اضافه نمی‌کند ولی برای گفت‌وگوهای طولانی سود واقعی دارد.

سوم و مهم برای واقع‌بینی: این هنوز ارزان‌ترین گزینه نیست. مدل‌های سبک همین بازار ده تا چهل برابر ارزان‌ترند و برای کار روزمره کافی‌اند. یک تذکر لازم هم اینکه این جدول عکسِ لحظه‌ای تعرفه‌هاست و تعرفه‌ها تغییر می‌کنند؛ ارقام این جدول در ۸ مهر ۱۴۰۵ بازبینی شده‌اند و مرجع همیشگی، عدد به‌روزِ هر مدل در کاتالوگ مدل‌هاست.

در یک ماه گذشته، بهترین کاری که می‌شد با گران‌ترین مدل بازار کرد، دو بار ارزان‌تر شده. اگر گردش‌کارتان را به یک مدل گران گره زده‌اید، هر چند هفته یک‌بار دوباره حساب کنید — نه به این دلیل که مدل بد شده، بلکه چون جایگزین ارزان‌ترش رسیده است.

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

  • سراغ GPT-6.1 Sol بروید وقتی کار جدی و حرفه‌ای دارید: کدنویسی، کار عاملی چندمرحله‌ای، پرسش از اسناد پیچیده، یا خودکارسازی گردش‌کار. این نقطه‌ی تعادل تازه‌ی «کیفیت بالا با هزینه‌ی معقول» است.
  • سراغ پرچم‌دار بروید فقط وقتی کارتان دقیقاً از جنس همان ردیفی است که در آن عقب است — کار با کامپیوتر — و آن دو واحد برایتان ارزش پنج برابر هزینه دارد.
  • سراغ یک مدل سبک بروید برای ترجمه، خلاصه، دسته‌بندی و پاسخ کوتاه؛ ده‌ها برابر ارزان‌ترند و تفاوتی حس نمی‌کنید.

لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدل‌ها همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.

پرسش‌های متداول

با نسخه‌ی هفته‌ی پیش چه فرقی دارد؟

در هر چهار سنجه‌ی منتشرشده بالاتر است و حافظه‌ی نهانش نصف قیمت شده، در حالی که تعرفه‌ی ورودی و خروجی دست‌نخورده مانده. یعنی ارتقا از آن نسخه عملاً هزینه‌ای ندارد و در گفت‌وگوهای طولانی حتی ارزان‌تر تمام می‌شود.

واقعاً به پرچم‌دار رسیده؟

در دو سنجه بله، با اختلافی در حد خطای اندازه‌گیری. در کار با کامپیوتر نه — حدود دو واحد عقب است. و این اعداد از خودِ سازنده‌اند. پس پاسخ دقیق‌تر این است: برای بیشتر کارها تفاوت محسوسی نخواهید دید، و پنج برابر کمتر می‌پردازید.

چرا سازنده محصول گران خودش را این‌طور کم‌اثر می‌کند؟

چون رقابت در این رده فشرده شده و هزینه‌ی سرویس‌دادن پایین آمده. برای شما نتیجه‌اش روشن است: قیمت رده‌ی بالا دارد سریع پایین می‌آید، و بهتر است هر چند هفته یک‌بار انتخابتان را دوباره بسنجید.

فارسی را خوب می‌فهمد؟

خانواده‌ی GPT در کار چندزبانه قوی است، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

GPT-6.1 Sol بهترین مدل جهان نیست، اما احتمالاً سنجیده‌ترین انتخاب امروز برای کار جدی است: در بیشتر سنجه‌ها به پرچم‌دارِ یک‌ماهه رسیده، با یک‌پنجم هزینه، و نسبت به نسخه‌ی هفته‌ی پیش هم بهتر شده بدون اینکه گران‌تر شود. تنها جایی که دنبال‌رو مانده، کار با کامپیوتر است.

ساده‌ترین راه قضاوت، امتحان‌کردن با کار خودتان است. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد.

مطالب دیگر