اگر امروز قصد دارید کل یک پایگاه کد یا هزاران صفحه سند را بدون استفاده از ابزارهای کمکی به یک مدل بفهمانید، عدد ۱۰ میلیون توکن در تبلیغات Meta میتواند وسوسهانگیز باشد. بر روی کاغذ، این ظرفیت اجازه میدهد تا هزاران صفحه متن — از کل کدهای یک پروژه گرفته تا آرشیو اسناد یا ساعتها متن پیادهشده از جلسات — در یک پرومپت واحد و بدون نیاز به RAG پردازش شوند. اما باید بدانید تفاوت میان «دیدن» داده و «فهمیدن» آن، در مدل Llama 4 Scout یک شکاف عمیق و خطرناک است. بررسیهای فنی در جولای ۲۰۲۶ نشان میدهد که بین ادعاهای بازاریابی و عملکرد واقعی، فاصله زیادی وجود دارد.
این ابهام در حالی رخ میدهد که صنعت از رابطهای سادهی چت به سمت پردازش بستر-متن (Context) در مقیاس عظیم حرکت میکند. مدلهایی مثل Gemini 2.5 Flash و GPT-4.1 پیشتر پنجرههای میلیونی را ارائه کردهاند و حالا شرکتها برای برنده شدن، روی اعداد تئوریک شرطبندی میکنند. برای اکثر توسعهدهندگان، وعدهٔ ۱۰ میلیون توکن یعنی پایان عصر نمایهگذاری دادهها؛ اما واقعیت فنی چیز دیگری است.
همانطور که در تحلیل قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، شفافیت در معماری مدلها برای درک محدودیتهای واقعی حیاتی است. مدل Llama 4 Scout و برادرش Maverick نخستین مدلهای ترکیب خبرهها (Mixture of Experts) — شبیه تیمی از متخصصان که هر کدام بخش خاصی از دانش را میدانند و فقط فرد لایق برای هر سؤال فراخوانده میشود — از خانواده لاما هستند. این مدلها در ۵ آوریل ۲۰۲۵ بهعنوان مدلهای چندوجهی (Multimodal) معرفی شدند. نسخه کامل این مدل با نام Llama-4-Scout-17B-16E-Instruct شناخته میشود.
به نقل از وبلاگ متا (۵ آوریل ۲۰۲۵)، مستندات NVIDIA NIM (۲۱ فوریه ۲۰۲۶) و پیکربندی چکپوینت مدل (۱۹ جولای ۲۰۲۶)، مشخصات فنی این مدل به شرح زیر است:
- پارامترهای فعال: ۱۷ میلیارد (کل پارامترها: ۱۰۹ میلیارد)
- تعداد خبرهها: ۱۶ خبره (یک خبره مسیریابیشونده به اضافه یک خبره مشترک برای هر توکن)
- معماری: ۴۸ لایه با بُعد پنهان ۵۱۲0
- دادههای آموزش: حدود ۴۰ تریلیون توکن (تاریخ قطع دانش: آگوست ۲۰۲۴)
- پنجره متنی اعلامشده: ۱۰,۴۸۵,۷۶۰ توکن
- پنجره متنی آموزش: ۲۵۶,۰۰۰ توکن
- زبانها: ۱۲ زبان بهصورت رسمی پشتیبانی میشوند (زبان روسی در این فهرست نیست)
- سختافزار هدف: یک عدد NVIDIA H100 با کوانتیزاسیون (Quantization) Int4
طبق بررسی فایل config.json مدل (ثبت شده در ۱۹ جولای ۲۰۲۶)، مقدار max_position_embeddings واقعاً روی ۱۰,۴۸۵,۷۶۰ تنظیم شده است که دقیقاً برابر با ۱۰ ضربدر ۲ به توان ۲۰ است. اما نکته اینجاست که مدل تنها با ۲۵۶ هزار توکن آموزش دیده است. Meta برای رسیدن به عدد ۱۰ میلیون از تکنیکی به نام iRoPE استفاده کرده که در واقع لایههای بدون رمزگذاری موقعیت (Positional Encoding) را جایگزین کرده و با اعمال مقیاسبندی دما (Temperature Scaling)، توجه مدل را فشرده میکند.
این یعنی «تعمیم طول»، نه پشتیبانی ذاتی. مدل هرگز در دوران آموزش ۱۰ میلیون توکن را ندیده و در لحظه استنتاج (Inference) — همان لحظهای که مدل واقعاً جواب تولید میکند — سعی میکند تواناییهایش را «بکشد». در فایل پیکربندی صراحتاً ذکر شده است: attn_temperature_tuning = true و attn_scale = 0.1 و rope_scaling از نوع llama3 با ضریب ۱۶ و مقدار original_max_position_embeddings = 8192 است.
علاوه بر این، اکثر لایهها در حالت «توجه تکهای» (Chunked Attention) عمل میکنند. مقدار attention_chunk_size در تنظیمات روی ۸,۱۹۲ قرار گرفته است. طبق تحلیلهای مستقل، تنها هر چهارمین لایه یک لایه توجه علّی کامل بدون رمزگذاری موقعیتی است. این بدان معناست که تقریباً ۷۵٪ لایهها فقط یک پنجره محلی ۸,۱۹۲ توکنی را میبینند و تنها ۲۵٪ لایهها مثل یک نورافکن کل متن را اسکن میکنند.
همچنین باید به یاد داشت که ۱۰ میلیون توکن با ۱۰ میلیون کلمه یکی نیست. توکنسازی (Tokenization) با استفاده از BPE (Byte Pair Encoding)، متن را به تکههای زیر-کلمهای تقسیم میکند، به این معنی که حجم واقعی کلمات بهطور قابلتوجهی کمتر است. هزینهها باید همیشه بر اساس توکن محاسبه شوند، نه تعداد صفحات.

محدودیت سختافزاری، نقطه شکست دوم است. اگرچه وزنهای فعال ۱۷ میلیاردی Llama 4 Scout در یک H100 با کوانتیزاسیون Int4 جا میشوند، اما KV Cache (حافظه موقت کلید-مقدار) با افزایش طول پرومپت بهصورت خطی رشد میکند. تکنیک iRoPE این رشد حافظه را حل نمیکند. باید توجه داشت که حافظه مورد نیاز برای وزنها با حافظه مورد نیاز برای بستر-متن متفاوت است.
بر اساس ارزیابیهای جامعهی گیتهاب (۴ مه ۲۰۲۵)، یک پل سختافزاری دشوار برای مدیریت بستر-متن وجود دارد:
- یک H100 (80GB): مدیریت حدود ۱۰۰ هزار توکن
- چهار H100: مدیریت حدود ۴۰۰ هزار توکن
- هشت H100: رسیدن به حدود ۱ میلیون توکن
- خوشههای چندگره (Multi-node clusters): برای محدوده ۱ تا ۱۰ میلیون توکن الزامی است.
بنابراین ادعای «اجرا روی یک H100» فقط مربوط به وزنهای مدل است، نه توانایی پردازش یک پرومپت با بستر-متن طولانی. وزنها جا میشوند، اما حافظه KV-cache برای ۱۰ میلیون توکن جا نمیشود.
تفاوت حیاتی میان «یافتن سوزن در انبار کاه» و «فهمیدن ماهیت کاه» وجود دارد. به گزارش آزمون Aumiqx در ۹ آوریل ۲۰۲۶، مدل در بازیابی تکفکتها (Needle-in-a-haystack) با دقت ۹۵٪ در ۱۰ میلیون توکن موفق بود؛ یعنی مدل میتواند یک حقیقت خاص را پیدا کند.
اما استدلال (Reasoning) بسیار زودتر فرو میپاشد. طبق گزارش TokenMix (۲۴ آوریل ۲۰۲۶)، مناطق شکست مدل چنین است:
- ۱۰۰ تا ۵۰۰ هزار: منطقه کاری مؤثر (Effective working zone)
- ۵۰۰ هزار تا ۱ میلیون: «سقوط استدلالی»؛ جایی که دقت در تحلیلهای چندمرحلهای (Multi-hop) به زیر ۴۰٪ میرسد.
- ۱ تا ۵ میلیون: منطقه شکننده (Fragile zone)
- ۵ تا ۱۰ میلیون: منطقه تبلیغاتی (Marketing zone)
در واقع مدل داده را میبیند، اما نمیتواند پیوند میان فکتهای دور از هم را درک کند. این یک مشکل سیستماتیک است. بنچمارک RULER سال ۲۰۲۴ مفهوم «طول بستر-متن مؤثر» را معرفی کرد و نشان داد اکثر مدلها مدتها پیش از رسیدن به سقف ادعایی، کیفیت پاسخدهی را از دست میدهند. Scout در آوریل ۲۰۲۵ به لیست BABILong اضافه شد و تأیید کرد که اگرچه میتواند فواصل طولانی را مدیریت کند، اما در ۱۰ میلیون توکن بهطور کامل عمل نمیکند.
ارائهدهندگان ابری بهدلیل هزینه بسیار بالای حافظه KV-cache، بهندرت پنجره ۱۰ میلیونی را ارائه میکنند. در جولای ۲۰۲۶، وضعیت بر اساس مشخصات مه تا جولای چنین است:
- Cloudflare Workers AI: پنجره ۱۳۱ هزار توکنی. هزینه: ۰.۲۷ دلار برای ۱ میلیون توکن ورودی، ۰.۸۵ دلار برای ۱ میلیون توکن خروجی. حداکثر خروجی: ۱۶,۳۸۴ توکن.
- GCP Vertex AI: پنجره ۳۲۸ هزار توکنی. هزینه: ۰.۲۰ دلار برای ۱ میلیون توکن ورودی، ۰.۶۵ دلار برای ۱ میلیون توکن خروجی.
- OpenRouter: عدد «۱۰ میلیون» را لیست کرده است (که به پیکربندی مدل اشاره دارد)، با قیمتهای شروع از ۰.۱۰ دلار برای ورودی و ۰.۳۰ دلار برای خروجی بسته به بکاند.
در مجموع ۱۲ ارائهدهنده Scout را توزیع میکنند و طبق دادههای LLMReference (۹ جولای ۲۰۲۶)، ارزانترین ورودی از ۰.۰۸ دلار برای هر میلیون توکن شروع میشود.
حتی تجمیعکنندههایی مثل OpenRouter مدل را بر اساس فایل تنظیمات به عنوان «۱۰ میلیون» معرفی میکنند، نه بر اساس محدودیت واقعی SLA ارائهدهنده. این یک تله است: برچسب توصیفکننده مدل است، نه سرویس. یک درخواست با ۱۰ میلیون توکن کامل، تنها برای بخش ورودی بین ۰.۸ تا ۲.۷ دلار هزینه خواهد داشت (بر اساس پایینترین نرخها). در عمل، با پنجرههای ۱۳۱ تا ۳۲۸ هزار توکنی، یک پرومپت طولانی بین ۰.۰۱ تا ۰.۰۹ دلار هزینه میکند.
مقایسه Scout با مدلهای دیگر خانواده لاما تفاوتهای ساختاری را نشان میدهد. Llama 4 Scout سبکترین مدل در خط تولید MoE است. برادرش، Llama 4 Maverick، همان ۱۷ میلیارد پارامتر فعال را دارد اما وزن کل آن بسیار بیشتر و ۴۰۰ میلیارد است (۱۲۸ خبره در مقابل ۱۶ خبره). Maverick به یک میزبان کامل H100 DGX نیاز دارد و پنجره اعلامشده متواضعتری یعنی ۱ میلیون توکن دارد.
بالاتر از آنها Behemoth قرار دارد؛ مدل «معلم» با ۲۸۸ میلیارد پارامتر فعال و حدود ۲ تریلیون پارامتر کل. علیرغم هیاهو، Behemoth تا جولای ۲۰۲۶ منتشر نشده بود.
| مدل | پارامتر فعال | کل پارامترها | خبرهها | پنجره متنی | سختافزار |
|---|---|---|---|---|---|
| Scout | ۱۷ میلیارد | ۱۰۹ میلیارد | ۱۶ | ۱۰ میلیون | 1x H100 (Int4) |
| Maverick | ۱۷ میلیارد | ۴۰۰ میلیارد | ۱۲۸ | ۱ میلیون | H100 DGX Host |
| Behemoth | ۲۸۸ میلیارد | ~۲ تریلیون | - | - | منتشر نشده |
اعتبار متا در بنچمارکها نیز زیر سؤال رفته است. در ۸ آوریل ۲۰۲۵، The Verge گزارش داد که متا در حال «دستکاری» (Gaming) بنچمارکهای AI است. ژان لکان، مدیر سابق AI متا، نیز در ژانویه ۲۰۲۶ به Financial Times اعتراف کرد که نتایج Llama 4 برای تورم نمرات، کمی «دستکاری» (Fudged) شدهاند و از نسخههای مختلف مدل برای تستهای مختلف استفاده شده است تا امتیازات بالاتر بروند. LMArena اشاره کرده بود که یک نسخه آزمایشی سفارشی از Maverick (Llama-4-Maverick-03-26-Experimental) با امتیاز ELO ۱۴۱۷ مقام دوم را گرفت، اما نسخه نهایی به رتبه ۳۲ سقوط کرد.
برای توسعهدهندگان، پنجره ۱۰ میلیونی جایگزین تولید بازیابیافزا (RAG) نمیشود. هزینه ارسال ۱۰ میلیون توکن در هر درخواست، چندین برابر بیشتر از یکبار نمایهگذاری دادهها و بازیابی قطعات کوچک است. این بهینهسازی هزینهای در حالی رخ میدهد که رقبای دیگر نیز بر کاهش قیمتها تمرکز کردهاند؛ برای مثال مدل Grok 4.5 توانسته هزینههای اجرای عاملهای کدنویسی را تا ۵۰٪ کاهش دهد. همچنین مدل محدودیتهای عملی شدیدی دارد:
- زبان: پشتیبانی رسمی تنها برای ۱۲ زبان. روسی پشتیبانی نمیشود. اگرچه مدل میتواند به روسی پاسخ دهد، اما این نتیجه دادههای آموزشی است و نه ضمانت سازنده.
- سختافزار: روی سختافزارهای خانگی یا دستگاههای Edge اجرا نمیشود. کاربرانی که به دنبال «Jetson Nano» یا «Jetson Orin» هستند، خواهند دید که این بردها برای ساختار MoE با ۱۰۹ میلیارد پارامتر ناکافی هستند. علاوه بر این، یک H100 تنها حدود ۱۰۰ هزار توکن بستر-متن را مدیریت میکند.
- استدلال: اگر وظیفه شما تحلیل پیوندها در یک آرشیو طولانی است (به جای جستجوی ساده)، منطقهای که فراتر از چند صد هزار توکن است، غیرقابل اعتماد است.
برای یافتن «طول زمینه مؤثر» در پروژههای واقعی، توسعهدهندگان باید تستهای دستی انجام دهند:
- ساخت مجموعه داده: استفاده از کدهای خودتان، آرشیو مکاتبات یا گزارشهای طولانی. در این راستا، ابزارهای متمرکز بر کدنویسی مانند مدل Kimi K2.7 Code که اکنون برای کاربران سازمانی گیتهاب در دسترس است، استانداردهای جدیدی برای تحلیل کدهای حجیم ارائه میدهند.
- تست سوزن (Needle-testing): قرار دادن فکتهای منحصربهفرد در اعماق ۲۵٪، ۵۰٪، ۷۵٪ و ۹۵٪.
- تست چند-گامی (Multi-hop): پرسیدن سوالاتی که نیاز به ترکیب فکتهایی از دو نقطه دور در سند دارد؛ استدلال معمولاً ابتدا در اینجا شکست میخورد.
- مقیاسبندی تدریجی: اجرای تستها در مقادیر ۳۲ هزار، ۱۲۸ هزار، ۲۵۶ هزار و سقف ارائهدهنده.

اگر برای تولید محصول بهینهسازی میکنید، استفاده از APIهای تجمیعی مثل provod.ai به شما اجازه میدهد بدون مدیریت قراردادهای متعدد یا استفاده از VPN، Scout را با Claude یا GPT مقایسه کنید تا بفهمید کدام-یک در متون طولانی واقعاً درست عمل میکند. این روش کمک میکند تا خطاهای دسترسی API (مثل «موجودی ناکافی») را از تخریب واقعی مدل تشخیص دهید.
در سه مورد نیازی به تجمیعکنندهها نیست:
- میزبانی شخصی (Self-hosting): اگر وزنهای رسمی را دانلود کرده و روی سختافزار خود اجرا میکنید، خودتان تصمیم میگیرید چه مقدار حافظه به KV-cache اختصاص یابد.
- تنظیم دقیق درون-سازمانی (On-prem Fine-tuning): هنگام فعالیت در یک محیط امن داخلی با استک سختافزاری خودتان.
- قراردادهای سازمانی: اگر حجم درخواستهای شما بهقدری زیاد است که قرارداد مستقیم با سازنده برای یک SLA خاص توجیهپذیر باشد.
در نهایت، هیچ تجمیعکنندهای نمیتواند پشتیبانی رسمی از زبان روسی را فراهم کند، زیرا این مورد در مدل پایه ارائه شده توسط متا وجود ندارد.
تحلیل خوشههای جستجوی کاربران
کاربران اغلب «Llama 4 Scout» را در کنار عباراتی جستجو میکنند که با مدلهای زبانی (LLM) مرتبط نیستند. باید اینها را تفکیک کرد:
- سختافزار/رباتها: «Fisher» به فلزیاب Fisher Gemini 3 اشاره دارد؛ «BayckRC Gemini» یک فرستنده پهپاد است؛ «Optimus» ربات تسلا است؛ «GR-1» و «Fourier» به رباتهای انساننما (Fourier GR-1) اشاره دارند. «Quest» هدست VR متا است و «A37» یک گوشی سامسونگ است.
- سایر مدلها: «119b» (Mistral Small 4)، «80b» (Qwen 3 Next)، «4.4» (Grok 4.4). شاخههای OpenAI شامل «gpt-4.1-mini» و نسخههای مختلف «gpt-5.x-codex» (مثل 5.1-codex, 5.3-codex-spark, 5.5-cyber) است. «ruGPT-3/3.5» مدلهای Sber هستند و «StepFun» یک آزمایشگاه AI چینی است.
- اشتباهات نوشتاری/آوایی: «DeepSeek» اغلب به صورت «дипсик» یا «дипсикз» نوشته میشود. «chft» غلط املایی ChatGPT است و «gpttunell» به ابزارهای دور زدن اشاره دارد.
- تولید رسانه: «Seedream» (ByteDance)، «Veo» (Google)، «Gen-2» (Runway)، «Flux Amber». سایر عبارات شامل LoRAهای «realism» برای Flux و Ideogram، هنر پیکسلی «8bit»، «kapwing» برای ویرایش ویدیو و «x-minus» برای آهنگهای بیکلام است.
- متفرقه: «WormGPT» یک مدل جعلی برای فیشینگ است و «Soraoraora» جستجوی تکراری برای مدل Sora شرکت OpenAI است.
پرسشهای متداول خوانندگان
مدل Scout واقعاً چه مقدار داده را نگه میدارد؟
پنجرههای کاری در محدوده صدها هزار توکن هستند. بازیابی (Retrieval) بهتر از استدلال (Reasoning) عمل میکند. باید طول مؤثر را برای وظیفه خاص خود اندازه بگیرید.
چرا محدودیت ۱۳۱-۳۲۸ هزار توکن در حالی که ادعای ۱۰ میلیون شده است؟
KV-cache هزینه پولی و حافظه دارد. ارائهدهندگان برای حفظ اقتصاد خوشهها، پنجره را محدود میکنند. برچسب «۱۰ میلیون» در لیستها توصیفکننده پیکربندی مدل است، نه SLA ارائهدهنده.
برای اسناد، Scout بهتر است یا Maverick؟
مدل Maverick وزنهای بیشتری دارد (۴۰۰ میلیارد) و ادعای ۱ میلیون توکن دارد، اما نیازهای سختافزاری بالاتری دارد (DGX Host). هر دو را با یک اجرای آزمایشی مقایسه کنید؛ پنجرههای اعلامشده بهندرت دقیق هستند.
هزینه برای یک میلیون توکن چقدر است؟
بر اساس نرخهای جولای ۲۰۲۶، هزینه ورودی حدود ۰.۰۸ تا ۰.۲۷ دلار برای هر میلیون توکن است. اما چون اکثر ارائهدهندگان هنوز پنجره یک میلیون توکنی کامل را اجازه نمیدهند، هزینههای واقعی برای پنجرههای فعلی معمولاً بین ۰.۰۱ تا ۰.۰۹ دلار است.
آیا میتوانم این مدل را در خانه اجرا کنم؟
خیر. H100 یک GPU مرکز داده است. سختافزارهای خانگی و بردهای Jetson نمیتوانند یک مدل MoE با ۱۰۹ میلیارد پارامتر را پشتیبانی کنند.
گام بعدی شما
- اگر از پنجرههای متنی بزرگ استفاده میکنید، حتماً تست «سوزن در انبار کاه» را با دادههای واقعی خودتان تکرار کنید.
- بهجای تکیه بر عدد ۱۰ میلیون، استراتژی RAG را برای کاهش هزینه استنتاج در اولویت قرار دهید.
- برای مقایسه نرخ خطای استدلال در متون طولانی، خروجیهای Scout را در محدوده ۵۰۰ هزار توکن با مدلهای رقیب بسنجید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو