DeepSeek V4.1 Flash: معماریای که خواندن را از نوشتن جدا کرد
دیپسیک نسل تازهی مدل سبک خود را منتشر کرد: DeepSeek V4.1 Flash، که سازنده آن را «کوچکترین عضو یک خانوادهی معماریِ تازه» مینامد — یعنی این مدل قرار است شروع یک نسل باشد، نه پایان یکی. جالبترین بخشش هم همین معماری است: مدل برای خواندن و نوشتن، مغزِ متفاوتی روشن میکند. در این مقاله میبینیم این یعنی چه، در سنجهها کجا ایستاده، و چرا با اینکه از نسل قبلِ خودش گرانتر است، همچنان یکی از کمهزینهترین گزینههای جدی بازار است.
DeepSeek V4.1 Flash دقیقاً چیست؟
یک مدل زبانی بزرگ از شرکت دیپسیک، در ردهی «Flash» یعنی مدلِ سریع و کمهزینهی خانواده. مشخصات کلیدی:
- ۵۵۲ میلیارد پارامتر کل با معماری ترکیب متخصصها — اما فقط بخش کوچکی از آن در هر درخواست روشن میشود.
- پنجرهی متن یک میلیون توکن.
- بینایی ذاتی؛ تصویر را از پایه میفهمد، نه از راه یک وصلهی جانبی.
- سرعت بسیار بالا — گزارشهای منتشرشده از حدود ۴۲۰ توکن در ثانیه در کارهای استدلالی طولانی خبر میدهند، که برای کارهای طولانی تفاوت محسوسی در زمان انتظار میسازد.
- سه سطح عمق استدلال (کم، زیاد، بیشینه) که در همین خانواده معرفی شده بود.
معماری تازه: مغزِ خواندن جدا از مغزِ نوشتن
غیرعادیترین بخش این مدل، تقسیم نامتقارن کار است. در معماریهای رایج، همان مقدار محاسبهای که برای خواندن ورودی خرج میشود برای تولید خروجی هم خرج میشود. اینجا اینطور نیست: طبق گزارشهای منتشرشده، برای خواندن ورودی حدود ۸ میلیارد پارامتر فعال میشود و برای نوشتن پاسخ حدود ۱۶ میلیارد — یعنی دو برابر.
منطقش ساده و درست است: خواندن یک سند بلند کارِ سنگینی نیست، اما نوشتن جوابِ درست هست. با این تقسیم، مدل میتواند ورودیهای خیلی بلند را ارزان بخواند و ظرفیت بیشترش را برای همان چند هزار توکنی نگه دارد که واقعاً تولید میکند. همین است که هم سرعت بالا و هم تعرفهی پایین را ممکن کرده.
خواندن و نوشتن دو کار متفاوتاند و تا امروز مدلها برای هر دو یک اندازه انرژی میگذاشتند. اینکه کسی بالاخره آنها را از هم جدا کرده، از هر ردیف جدول بنچمارک خبر مهمتری است.
— تیم هوشواره
کارنامهی بنچمارکها
جدول زیر ارقامی است که سازنده در یادداشت رسمی انتشار منتشر کرده. عددهای بزرگتر بهترند (بهجز ردیف Codeforces که رتبه است).
| سنجه | چه میسنجد | امتیاز |
|---|---|---|
| Terminal-Bench 2.1 | کار در خط فرمان | ۹۰٫۶ |
| DeepSWE v1.1 | حل مستقل مسائل مهندسی نرمافزار | ۷۴٫۲ |
| NL2Repo-Bench | ساخت یک مخزن کد از روی توضیح | ۶۵٫۴ |
| Codeforces (رتبه) | مسابقهی برنامهنویسی الگوریتمی | ۳۴۷۱ |
| GPQA Diamond | پرسشهای علمی سطح دکتری | ۹۰٫۹ |
| MathArena Apex | ریاضیات رقابتی | ۶۵٫۶ |
| AutomationBench | خودکارسازی گردشکار اداری | ۵۴٫۸ |
| Agents' Last Exam | کار حرفهای واقعی در نرمافزارها | ۳۱٫۸ |
| HLE — با ابزار / بدون ابزار | دانش و استدلال سطح بالا | ۶۳٫۹ / ۳۶٫۸ |
| CyberGym | کشف آسیبپذیری نرمافزاری | ۸۸٫۱ |
| Chartography (با ابزار) | خواندن و تحلیل نمودار | ۷۸٫۹ |
| BabyVision (با ابزار) | ادراک بصری پایه | ۸۹٫۶ |
تصویر روشن است و دو رو دارد. در کارهای عملی — خط فرمان، مهندسی نرمافزار، خودکارسازی، کشف آسیبپذیری — اعدادش در ردهی مدلهای بهمراتب گرانتر میایستد؛ برای نمونه در سنجهی حل مستقل مسائل مهندسی نرمافزار امتیازش عملاً همتراز گرانترین پرچمدار بازار است.
در مقابل، در دانشِ عمیق عقب است: در HLE بدون ابزار ۳۶٫۸ میگیرد، در حالی که پرچمداران ردهی بالا در همین آزمون در محدودهی ۵۵ تا ۶۵ هستند. در سنجهی کار حرفهای واقعی هم ۳۱٫۸ در برابر عددهای نزدیک به ۶۰ برای گرانترین مدلها. پس این مدل برای «کار را انجام بده» ساخته شده، نه برای «سختترین سؤال دنیا را جواب بده».
و همان تذکر همیشگی: این اعداد را خودِ سازنده منتشر کرده و با ابزار آزمون خودش گرفته است. مقایسهی رقمبهرقم میان سازندههای مختلف قابل اتکا نیست، چون هرکدام آزمون را با تنظیمات خودشان اجرا میکنند؛ آنچه میشود گفت جهت کلی است، نه اختلاف چند دهم.
مقایسهی هزینه: دو خبر، یکی خوب و یکی بد
برای اینکه مقایسه معنادار باشد، هزینهی DeepSeek V4.1 Flash را برابر ۱ میگیریم. ستون آخر یک ترکیب واقعگرایانه از گفتوگوی معمولی است (۵ واحد ورودی به ازای هر ۱ واحد خروجی).
| مدل | شاخص ورودی | شاخص خروجی | شاخص حافظهی نهان | شاخص گفتوگوی معمول |
|---|---|---|---|---|
| DeepSeek V4.1 Flash | ۱٫۰ | ۱٫۰ | ۱٫۰ | ۱٫۰۰ |
| DeepSeek V4 Flash (نسل قبل) | ۰٫۴۳ | ۰٫۳۰ | ۵٫۳ | ۰٫۳۷ |
| GLM-5.3 Flash | ۱٫۰ | ۰٫۸۳ | ۱۰ | ۰٫۹۳ |
| Gemini 3.8 Flash | ۵٫۰ | ۶٫۳ | ۲۵ | ۵٫۶ |
| GLM-5.3 | ۹٫۳ | ۷٫۳ | ۸۷ | ۸٫۴ |
| GPT-5.6 Sol | ۱۳٫۳ | ۱۶٫۷ | ۶۷ | ۱۵ |
| Claude Opus 5 | ۳۳ | ۴۲ | ۱۶۷ | ۳۷ |
| GPT-6 Astra | ۶۷ | ۸۳ | ۳۳۳ | ۷۴ |
خبر خوب: در برابر پرچمداران، فاصله حیرتآور است. گرانترین مدل این فهرست برای همان گفتوگو حدود هفتاد و چهار برابر خرج برمیدارد — در حالی که، همانطور که بالا دیدیم، در چند سنجهی عملی اختلافشان ناچیز است.
خبر بد: نسبت به نسل قبلیِ خودش گرانتر شده، حدود دو و نیم برابر. اگر گردشکارتان روی نسخهی قبلی DeepSeek Flash سوار است، این ارتقا خودکار بهصرفه نیست و باید آگاهانه انتخابش کنید.
اما یک ستون سوم هم هست که ورق را برمیگرداند: حافظهی نهان. هزینهی «یادآوری» متنی که قبلاً فرستادهاید در این مدل حدود یکپنجاهمِ ورودی عادی است — بهمراتب ارزانتر از نسل قبل و از تقریباً هر مدل دیگری در جدول. یعنی اگر کارتان گفتوگوی طولانی و ادامهدار روی یک زمینهی ثابت است، گرانیِ ظاهریاش تا حد زیادی جبران میشود و حتی میتواند ارزانتر تمام شود.
یک تذکر لازم: این جدول عکسِ لحظهای تعرفههاست و تعرفهها تغییر میکنند؛ مرجع همیشگی، عدد بهروزِ هر مدل در کاتالوگ مدلهاست.
یک مدل تازه لزوماً ارزانتر از مدل قبلیِ خودش نیست. «نسخهی جدیدتر» یعنی بهتر، نه یعنی بهصرفهتر — و این دو را فقط با اجرای کار واقعی خودتان میشود از هم جدا کرد.
یک نکته برای کسانی که روی نسل قبلی ساختهاند
سازنده اعلام کرده نسل پیشین این خانواده را بهتدریج بازنشسته میکند و درخواستهایی که با نامهای قدیمی فرستاده میشوند را به همین مدل تازه هدایت خواهد کرد. اگر روی یکی از نسخههای قبلی DeepSeek گردشکاری ساختهاید، بد نیست از همین حالا خروجی و هزینهی کارتان را با نسخهی تازه بسنجید تا بعداً غافلگیر نشوید. فهرست کامل نسخههای در دسترس، همیشه در کاتالوگ مدلهاست.
پس چهوقت این مدل، چهوقت مدل دیگر؟
- سراغ DeepSeek V4.1 Flash بروید وقتی حجم کارتان بالاست و هزینه تعیینکننده است، کار عاملی و کدنویسی دارید، سرعت برایتان مهم است، یا گفتوگوهای طولانیِ ادامهدار روی یک سند یا پروژه دارید — همانجا که حافظهی نهانِ ارزانش بیشترین اثر را میگذارد.
- سراغ یک پرچمدار بروید وقتی مسئله دانشیِ عمیق است یا کار حرفهای پیچیدهای در نرمافزارهای تخصصی در جریان است — دو دستهای که جدول بالا صریحاً نشان میدهد این مدل در آنها دنبالرو است. مثل GPT-6 Astra، به شرط آنکه هفتاد برابر هزینه برایتان توجیه داشته باشد.
- سراغ نسل قبلی یا یک مدل سبکتر بروید اگر کارتان ساده و پرتکرار است؛ در آن دسته، ارزانتر بودن مهمتر از چند واحد امتیاز بیشتر است.
لازم هم نیست از پیش تصمیم بگیرید: در آرنای مدلها همان درخواست واقعی خودتان را همزمان به چند مدل بدهید و پاسخ و هزینه را کنار هم ببینید.
پرسشهای متداول
یعنی میتواند جای مدلهای گران را بگیرد؟
برای بخش بزرگی از کارها بله، مخصوصاً کدنویسی و کارهای چندمرحلهای. برای پرسشهای دانشیِ سنگین نه — در همان سنجهها با فاصله عقب است. راه درست این است که کارهای روزمره را به این بسپارید و مدل گران را برای مسائل واقعاً سخت نگه دارید.
«۸ میلیارد برای خواندن، ۱۶ میلیارد برای نوشتن» یعنی چه؟
یعنی مدل برای هضم متنی که به آن میدهید نصفِ توانی را خرج میکند که برای ساختن جواب خرج میکند. نتیجهاش برای شما این است که فرستادن متن بلند ارزانتر و سریعتر تمام میشود، بدون اینکه کیفیت جواب فدا شود.
چرا با اینکه «Flash» است، از Flash قبلی گرانتر شده؟
چون مدل بزرگتر و تواناتری است و روی معماری تازهای ساخته شده. «Flash» در این خانواده یعنی سبکترین عضو همان نسل، نه ارزانترین مدل تاریخ. اگر کارتان با نسخهی قبلی راه میافتاد، همان انتخاب هنوز معتبر است.
تصویر را واقعاً میفهمد؟
بله، و بینایی در این نسخه از پایه در مدل تعبیه شده. در سنجههای خواندن نمودار و ادراک بصری اعداد خوبی گرفته است. مثل همیشه، بهترین آزمون یک نمونهی واقعی از کار خودتان است.
فارسی را خوب میفهمد؟
این خانواده در کار چندزبانه عملکرد خوبی دارد، اما هیچ سنجهی عمومیای کیفیت فارسی را جداگانه اندازه نمیگیرد. توصیهی ما ساده است: یک نمونهی واقعی از کار خودتان را در آرنا به دو سه مدل بدهید و خودتان قضاوت کنید.
چطور در هوشواره از آن استفاده کنم؟
مثل هر مدل دیگر: در صفحهی گفتوگو از فهرست مدلها انتخابش کنید و در صورت نیاز تصویر هم به گفتوگو اضافه کنید. هزینهی هر پاسخ پیش و پس از ارسال بهصورت تومانی نمایش داده میشود. اگر توسعهدهندهاید، از طریق API هم در دسترس است.
جمعبندی
DeepSeek V4.1 Flash بهترین مدل جهان نیست و ادعایش هم این نیست. چیزی که هست جالبتر است: مدلی با معماری تازه که خواندن و نوشتن را از هم جدا کرده، در کارهای عملی به پرچمداران نزدیک میشود، سریع است، و این را با کسری از هزینهی آنها انجام میدهد — به شرط آنکه بدانید در پرسشهای دانشیِ سنگین دنبالرو است و نسبت به نسل قبلِ خودش گرانتر شده.
سادهترین راه قضاوت، امتحانکردن با کار خودتان است. فهرست کامل مدلها و تعرفهی تومانی هرکدام در کاتالوگ مدلها و طرحهای اشتراک در صفحهی تعرفهها است. حساب ندارید؟ ثبتنام کمتر از یک دقیقه طول میکشد.