DeepSeek V4.1 Flash: معماری‌ای که خواندن را از نوشتن جدا کرد

DeepSeek V4.1 Flash: معماری‌ای که خواندن را از نوشتن جدا کرد

DeepSeek V4.1 Flash دیپ‌سیک مدل زبانی بزرگ مدل چندوجهی مقایسه مدل‌های هوش مصنوعی هزینه هوش مصنوعی بنچمارک هوش مصنوعی هوش مصنوعی عاملی

دیپ‌سیک نسل تازه‌ی مدل سبک خود را منتشر کرد: DeepSeek V4.1 Flash، که سازنده آن را «کوچک‌ترین عضو یک خانواده‌ی معماریِ تازه» می‌نامد — یعنی این مدل قرار است شروع یک نسل باشد، نه پایان یکی. جالب‌ترین بخشش هم همین معماری است: مدل برای خواندن و نوشتن، مغزِ متفاوتی روشن می‌کند. در این مقاله می‌بینیم این یعنی چه، در سنجه‌ها کجا ایستاده، و چرا با اینکه از نسل قبلِ خودش گران‌تر است، همچنان یکی از کم‌هزینه‌ترین گزینه‌های جدی بازار است.

DeepSeek V4.1 Flash دقیقاً چیست؟

یک مدل زبانی بزرگ از شرکت دیپ‌سیک، در رده‌ی «Flash» یعنی مدلِ سریع و کم‌هزینه‌ی خانواده. مشخصات کلیدی:

  • ۵۵۲ میلیارد پارامتر کل با معماری ترکیب متخصص‌ها — اما فقط بخش کوچکی از آن در هر درخواست روشن می‌شود.
  • پنجره‌ی متن یک میلیون توکن.
  • بینایی ذاتی؛ تصویر را از پایه می‌فهمد، نه از راه یک وصله‌ی جانبی.
  • سرعت بسیار بالا — گزارش‌های منتشرشده از حدود ۴۲۰ توکن در ثانیه در کارهای استدلالی طولانی خبر می‌دهند، که برای کارهای طولانی تفاوت محسوسی در زمان انتظار می‌سازد.
  • سه سطح عمق استدلال (کم، زیاد، بیشینه) که در همین خانواده معرفی شده بود.

معماری تازه: مغزِ خواندن جدا از مغزِ نوشتن

غیرعادی‌ترین بخش این مدل، تقسیم نامتقارن کار است. در معماری‌های رایج، همان مقدار محاسبه‌ای که برای خواندن ورودی خرج می‌شود برای تولید خروجی هم خرج می‌شود. اینجا این‌طور نیست: طبق گزارش‌های منتشرشده، برای خواندن ورودی حدود ۸ میلیارد پارامتر فعال می‌شود و برای نوشتن پاسخ حدود ۱۶ میلیارد — یعنی دو برابر.

منطقش ساده و درست است: خواندن یک سند بلند کارِ سنگینی نیست، اما نوشتن جوابِ درست هست. با این تقسیم، مدل می‌تواند ورودی‌های خیلی بلند را ارزان بخواند و ظرفیت بیشترش را برای همان چند هزار توکنی نگه دارد که واقعاً تولید می‌کند. همین است که هم سرعت بالا و هم تعرفه‌ی پایین را ممکن کرده.

خواندن و نوشتن دو کار متفاوت‌اند و تا امروز مدل‌ها برای هر دو یک اندازه انرژی می‌گذاشتند. اینکه کسی بالاخره آن‌ها را از هم جدا کرده، از هر ردیف جدول بنچمارک خبر مهم‌تری است.

— تیم هوشواره

کارنامه‌ی بنچمارک‌ها

جدول زیر ارقامی است که سازنده در یادداشت رسمی انتشار منتشر کرده. عددهای بزرگ‌تر بهترند (به‌جز ردیف Codeforces که رتبه است).

سنجهچه می‌سنجدامتیاز
Terminal-Bench 2.1کار در خط فرمان۹۰٫۶
DeepSWE v1.1حل مستقل مسائل مهندسی نرم‌افزار۷۴٫۲
NL2Repo-Benchساخت یک مخزن کد از روی توضیح۶۵٫۴
Codeforces (رتبه)مسابقه‌ی برنامه‌نویسی الگوریتمی۳۴۷۱
GPQA Diamondپرسش‌های علمی سطح دکتری۹۰٫۹
MathArena Apexریاضیات رقابتی۶۵٫۶
AutomationBenchخودکارسازی گردش‌کار اداری۵۴٫۸
Agents' Last Examکار حرفه‌ای واقعی در نرم‌افزارها۳۱٫۸
HLE — با ابزار / بدون ابزاردانش و استدلال سطح بالا۶۳٫۹ / ۳۶٫۸
CyberGymکشف آسیب‌پذیری نرم‌افزاری۸۸٫۱
Chartography (با ابزار)خواندن و تحلیل نمودار۷۸٫۹
BabyVision (با ابزار)ادراک بصری پایه۸۹٫۶

تصویر روشن است و دو رو دارد. در کارهای عملی — خط فرمان، مهندسی نرم‌افزار، خودکارسازی، کشف آسیب‌پذیری — اعدادش در رده‌ی مدل‌های به‌مراتب گران‌تر می‌ایستد؛ برای نمونه در سنجه‌ی حل مستقل مسائل مهندسی نرم‌افزار امتیازش عملاً هم‌تراز گران‌ترین پرچم‌دار بازار است.

در مقابل، در دانشِ عمیق عقب است: در HLE بدون ابزار ۳۶٫۸ می‌گیرد، در حالی که پرچم‌داران رده‌ی بالا در همین آزمون در محدوده‌ی ۵۵ تا ۶۵ هستند. در سنجه‌ی کار حرفه‌ای واقعی هم ۳۱٫۸ در برابر عددهای نزدیک به ۶۰ برای گران‌ترین مدل‌ها. پس این مدل برای «کار را انجام بده» ساخته شده، نه برای «سخت‌ترین سؤال دنیا را جواب بده».

و همان تذکر همیشگی: این اعداد را خودِ سازنده منتشر کرده و با ابزار آزمون خودش گرفته است. مقایسه‌ی رقم‌به‌رقم میان سازنده‌های مختلف قابل اتکا نیست، چون هرکدام آزمون را با تنظیمات خودشان اجرا می‌کنند؛ آنچه می‌شود گفت جهت کلی است، نه اختلاف چند دهم.

مقایسه‌ی هزینه: دو خبر، یکی خوب و یکی بد

برای اینکه مقایسه معنادار باشد، هزینه‌ی DeepSeek V4.1 Flash را برابر ۱ می‌گیریم. ستون آخر یک ترکیب واقع‌گرایانه از گفت‌وگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).

مدلشاخص ورودیشاخص خروجیشاخص حافظه‌ی نهانشاخص گفت‌وگوی معمول
DeepSeek V4.1 Flash۱٫۰۱٫۰۱٫۰۱٫۰۰
DeepSeek V4 Flash (نسل قبل)۰٫۴۳۰٫۳۰۵٫۳۰٫۳۷
GLM-5.3 Flash۱٫۰۰٫۸۳۱۰۰٫۹۳
Gemini 3.8 Flash۵٫۰۶٫۳۲۵۵٫۶
GLM-5.3۹٫۳۷٫۳۸۷۸٫۴
GPT-5.6 Sol۱۳٫۳۱۶٫۷۶۷۱۵
Claude Opus 5۳۳۴۲۱۶۷۳۷
GPT-6 Astra۶۷۸۳۳۳۳۷۴

خبر خوب: در برابر پرچم‌داران، فاصله حیرت‌آور است. گران‌ترین مدل این فهرست برای همان گفت‌وگو حدود هفتاد و چهار برابر خرج برمی‌دارد — در حالی که، همان‌طور که بالا دیدیم، در چند سنجه‌ی عملی اختلافشان ناچیز است.

خبر بد: نسبت به نسل قبلیِ خودش گران‌تر شده، حدود دو و نیم برابر. اگر گردش‌کارتان روی نسخه‌ی قبلی DeepSeek Flash سوار است، این ارتقا خودکار به‌صرفه نیست و باید آگاهانه انتخابش کنید.

اما یک ستون سوم هم هست که ورق را برمی‌گرداند: حافظه‌ی نهان. هزینه‌ی «یادآوری» متنی که قبلاً فرستاده‌اید در این مدل حدود یک‌پنجاهمِ ورودی عادی است — به‌مراتب ارزان‌تر از نسل قبل و از تقریباً هر مدل دیگری در جدول. یعنی اگر کارتان گفت‌وگوی طولانی و ادامه‌دار روی یک زمینه‌ی ثابت است، گرانیِ ظاهری‌اش تا حد زیادی جبران می‌شود و حتی می‌تواند ارزان‌تر تمام شود.

یک تذکر لازم: این جدول عکسِ لحظه‌ای تعرفه‌هاست و تعرفه‌ها تغییر می‌کنند؛ مرجع همیشگی، عدد به‌روزِ هر مدل در کاتالوگ مدل‌هاست.

یک مدل تازه لزوماً ارزان‌تر از مدل قبلیِ خودش نیست. «نسخه‌ی جدیدتر» یعنی بهتر، نه یعنی به‌صرفه‌تر — و این دو را فقط با اجرای کار واقعی خودتان می‌شود از هم جدا کرد.

یک نکته برای کسانی که روی نسل قبلی ساخته‌اند

سازنده اعلام کرده نسل پیشین این خانواده را به‌تدریج بازنشسته می‌کند و درخواست‌هایی که با نام‌های قدیمی فرستاده می‌شوند را به همین مدل تازه هدایت خواهد کرد. اگر روی یکی از نسخه‌های قبلی DeepSeek گردش‌کاری ساخته‌اید، بد نیست از همین حالا خروجی و هزینه‌ی کارتان را با نسخه‌ی تازه بسنجید تا بعداً غافلگیر نشوید. فهرست کامل نسخه‌های در دسترس، همیشه در کاتالوگ مدل‌هاست.

پس چه‌وقت این مدل، چه‌وقت مدل دیگر؟

  • سراغ DeepSeek V4.1 Flash بروید وقتی حجم کارتان بالاست و هزینه تعیین‌کننده است، کار عاملی و کدنویسی دارید، سرعت برایتان مهم است، یا گفت‌وگوهای طولانیِ ادامه‌دار روی یک سند یا پروژه دارید — همان‌جا که حافظه‌ی نهانِ ارزانش بیشترین اثر را می‌گذارد.
  • سراغ یک پرچم‌دار بروید وقتی مسئله دانشیِ عمیق است یا کار حرفه‌ای پیچیده‌ای در نرم‌افزارهای تخصصی در جریان است — دو دسته‌ای که جدول بالا صریحاً نشان می‌دهد این مدل در آن‌ها دنبال‌رو است. مثل GPT-6 Astra، به شرط آنکه هفتاد برابر هزینه برایتان توجیه داشته باشد.
  • سراغ نسل قبلی یا یک مدل سبک‌تر بروید اگر کارتان ساده و پرتکرار است؛ در آن دسته، ارزان‌تر بودن مهم‌تر از چند واحد امتیاز بیشتر است.

لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدل‌ها همان درخواست واقعی خودتان را هم‌زمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.

پرسش‌های متداول

یعنی می‌تواند جای مدل‌های گران را بگیرد؟

برای بخش بزرگی از کارها بله، مخصوصاً کدنویسی و کارهای چندمرحله‌ای. برای پرسش‌های دانشیِ سنگین نه — در همان سنجه‌ها با فاصله عقب است. راه درست این است که کارهای روزمره را به این بسپارید و مدل گران را برای مسائل واقعاً سخت نگه دارید.

«۸ میلیارد برای خواندن، ۱۶ میلیارد برای نوشتن» یعنی چه؟

یعنی مدل برای هضم متنی که به آن می‌دهید نصفِ توانی را خرج می‌کند که برای ساختن جواب خرج می‌کند. نتیجه‌اش برای شما این است که فرستادن متن بلند ارزان‌تر و سریع‌تر تمام می‌شود، بدون اینکه کیفیت جواب فدا شود.

چرا با اینکه «Flash» است، از Flash قبلی گران‌تر شده؟

چون مدل بزرگ‌تر و تواناتری است و روی معماری تازه‌ای ساخته شده. «Flash» در این خانواده یعنی سبک‌ترین عضو همان نسل، نه ارزان‌ترین مدل تاریخ. اگر کارتان با نسخه‌ی قبلی راه می‌افتاد، همان انتخاب هنوز معتبر است.

تصویر را واقعاً می‌فهمد؟

بله، و بینایی در این نسخه از پایه در مدل تعبیه شده. در سنجه‌های خواندن نمودار و ادراک بصری اعداد خوبی گرفته است. مثل همیشه، بهترین آزمون یک نمونه‌ی واقعی از کار خودتان است.

فارسی را خوب می‌فهمد؟

این خانواده در کار چندزبانه عملکرد خوبی دارد، اما هیچ سنجه‌ی عمومی‌ای کیفیت فارسی را جداگانه اندازه نمی‌گیرد. توصیه‌ی ما ساده است: یک نمونه‌ی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.

چطور در هوشواره از آن استفاده کنم؟

مثل هر مدل دیگر: در صفحه‌ی گفت‌وگو از فهرست مدل‌ها انتخابش کنید و در صورت نیاز تصویر هم به گفت‌وگو اضافه کنید. هزینه‌ی هر پاسخ پیش و پس از ارسال به‌صورت تومانی نمایش داده می‌شود. اگر توسعه‌دهنده‌اید، از طریق API هم در دسترس است.

جمع‌بندی

DeepSeek V4.1 Flash بهترین مدل جهان نیست و ادعایش هم این نیست. چیزی که هست جالب‌تر است: مدلی با معماری تازه که خواندن و نوشتن را از هم جدا کرده، در کارهای عملی به پرچم‌داران نزدیک می‌شود، سریع است، و این را با کسری از هزینه‌ی آن‌ها انجام می‌دهد — به شرط آنکه بدانید در پرسش‌های دانشیِ سنگین دنبال‌رو است و نسبت به نسل قبلِ خودش گران‌تر شده.

ساده‌ترین راه قضاوت، امتحان‌کردن با کار خودتان است. فهرست کامل مدل‌ها و تعرفه‌ی تومانی هرکدام در کاتالوگ مدل‌ها و طرح‌های اشتراک در صفحه‌ی تعرفه‌ها است. حساب ندارید؟ ثبت‌نام کمتر از یک دقیقه طول می‌کشد.

مطالب دیگر