اگر برای پردازش متون حقوقی یا اداری در محیطهای حساس کار میکنید، هزینه استنتاج شما میتواند بهطور محسوسی کاهش یابد. مدل Kolibri که در ۳ اکتبر ۲۰۲۶ توسط شرکت Aleph Alpha منتشر شد، مصرف توکنها را در زبان آلمانی تا ۱۵٪ کاهش داده است. این مدل یک مدل با وزنهای باز (Open-weight) از نوع ترکیب خبرهها (Mixture of Experts یا MoE) است که بهطور کامل روی خاک اروپا اجرا میشود. Kolibri (به معنای مرغ مگسخوار در آلمانی، اشارهای به پروفایل محاسباتی سبک آن) در استدلالهای مربوط به زبان آلمانی و بازیابی متون با بستر طولانی، از رقبای هماندازه خود پیشی میگیرد. این مدل برای ایجاد تعادل میان نوآوریهای با عملکرد بالا و الزامات سختگیرانه حریم خصوصی دادههای «قانون هوش مصنوعی اتحادیه اروپا» (EU AI Act) طراحی شده است. فایلهای پیکربندی و وزنهای مدل تحت لایسنس Apache 2.0 در Hugging Face در دسترس عموم قرار گرفته است.
این عرضه در حالی رخ میدهد که سازمانهای اروپایی برای تطبیق قدرت مدلهای پیشرو آمریکایی با قوانین سختگیرانه حاکمیتی دستوپنجه نرم میکنند. همانطور که در تحلیل قبلی ما دربارهی استفاده شرکتهایی مثل Funding Fit از مدلهای محلی برای کنترل دادهها اشاره کردیم، Kolibri مسیری آماده برای بخشهایی فراهم میکند که دادهها هرگز نباید از محیط سازمان خارج شوند. این مدل بهطور خاص برای کاربران «حاکمیتی» مانند وزارتخانهها، تأمینکنندگان قطعات خودرو یا بیمارستانها ساخته شده است که نیازمند آزادی کامل در استقرار و امنیت مالکیت معنوی هستند.
تعریف حاکمیت داده
Aleph Alpha حاکمیت را از دو منظر اصلی تعریف میکند:
- ساختار و ساخت: مدل توسط تیمهایی در آلمان و روی زیرساختهایی در آلمان و فنلاند، تحت قوانین اروپا و آلمان و بدون هیچگونه کنترل خارجی ساخته و آموزش دیده است.
- حقوق مشتری: کاربران آزادی کامل در استقرار و امنیت مالکیت معنوی دارند؛ به این معنا که انطباق با قوانین، یک «ویژگی ارثبری شده» در مدل است.
برای تقویت این تعهد، Aleph Alpha «کد رویه هوش مصنوعی با هدف عمومی» (GPAI Code of Practice) اتحادیه اروپا را امضا کرده است. با این حال، حاکمیت به معنای انزوای کامل نیست. در کارت مدل (Model Card) ذکر شده است که متون وب انگلیسی با استفاده از مدل Gemma 4 گوگل و متون آلمانی با استفاده از Mistral-NeMo بازنویسی شدهاند. همچنین از دادههای برچسبگذاری شده Qwen3-32B برای فیلترهای کیفی استفاده شده است. تیم توسعهدهنده بهطور خاص دادههای آموزشی را فیلتر کردند تا سوگیریهای سیاسی که اغلب در مدلهای باز چینی یافت میشود (و خودشان در آن مدلها اندازهگیری کرده بودند) را حذف کنند.
معماری بهینهسازی شده
مدل Kolibri دارای ۷۸.۱ میلیارد پارامتر است، اما مانند مدلهای متراکم (Dense) عمل نمیکند. این مدل از معماری ترکیب خبرهها (MoE) با ۵۰ لایه تشکیل شده است که هر لایه شامل ۳۸۴ متخصص به علاوه یک متخصص مشترک است. برای هر توکن پردازش شده، یک مسیریاب (Router) تنها ۶ متخصص از میان اینها را انتخاب میکند. این رویکرد در راستای تکامل معماریهای بهینه است که در مخزن متنباز OpenArch، پیادهسازیهای متنوعی از ۷۲ معماری مدرن LLM برای تحلیل و توسعه ارائه شده است.
این یعنی مدل حافظه یک مدل ۷۸ میلیارد پارامتری را میطلبد، اما در هر لحظه تنها ۳.۴۶ میلیارد پارامتر (حدود ۴.۴٪ کل) فعال هستند و کار واقعی را انجام میدهند. طبق گزارش فنی Aleph Alpha، این سازوکار اجازه میدهد هوش مدل در سطح بالا باقی بماند اما هزینه استنتاج (Inference) — یعنی همان لحظه تولید جواب — کمتر از جایگزینهای متراکم باشد. این کاهش هزینههای عملیاتی یادآور رویکرد مدلهای Smaug است که توانستند هزینههای حلقههای عاملهای هوش مصنوعی را تا ۱۰۰ برابر کاهش دهند.
استعاره متخصصان
برای درک بهتر این موضوع، پزشکی را تصور کنید که تمام کتابهای پزشکی جهان را خوانده است در مقابل متخصصی در خونشناسی (هماتولوژی). اگر شما بیماری خونی داشته باشید، پزشک عمومی ممکن است به دلیل «دانستن بیش از حد» اطلاعات نامرتبط، پاسخ اشتباه بدهد. یک مدل MoE مانند بیمارستانی است که پر از متخصص است و مسیریاب نقش پذیرش را دارد که توکن را به ۶ متخصص درست میفرستد.
دو نکته مهم در این استعاره وجود دارد:
- الگو-محور، نه موضوع-محور: متخصصان بر اساس موضوعاتی مثل «حقوق آلمان» تقسیم نشدهاند؛ بلکه معمولاً الگوهای توکنی مانند علائم نگارشی یا اسامی خاص را مدیریت میکنند.
- سربار حافظه: بیمارستان باید تمام ۳۸۴ متخصص را در کادر خود نگه دارد، حتی اگر در هر لحظه فقط ۶ نفر دیده شوند. همانطور که در کارت مدل آمده است: «کل مدل باید در حافظه نگه داشته شود، حتی اگر در هر لحظه تنها بخشی از آن فعال باشد».
حل شکاف زبانی آلمانی
بزرگترین دستاورد Kolibri در توکنسازی (Tokenization) — یعنی تبدیل متن به تکههای کوچک شبیه برشهای کیک که مدل آنها را میخورد — نهفته است. اکثر مدلها با توکنسازهای انگلیسی آموزش دیدهاند که کلمات ترکیبی پیچیده آلمانی را به تکههای کوچک و ناکارآمد خرد میکنند. برای مثال، نام دادگاه قانون اساسی فدرال در توکنساز o200k_base به ۶ توکن تقسیم میشود (Bund | es | ver | fass | ungs | gericht)، اما در Kolibri تنها به ۲ توکن تبدیل میشود (Bundes | verfassungsgericht).
این شرکت الگوریتمی به نام UniBPE توسعه داده است. این توکنساز ادغام پایین به بالای کدگذاری جفت-بایت (BPE) را حفظ میکند اما هر ادغام را با یک قانون امتیازدهی متفاوت (هدف Unigram) انتخاب میکند تا نحوه ساخت کلمات در زبان آلمانی را رعایت کند. این منجر به کاهش ۱۱.۲ درصدی توکنها برای متون عمومی آلمانی در مقایسه با GPT-5 شده است.
بنچمارکهای توکنسازی
در آزمونی خاص روی قانون اساسی جمهوری فدرال آلمان (۱۸۵ کیلوبایت متن حقوقی)، Kolibri به ۱۵٪ توکن کمتری نسبت به توکنساز o200k_base مورد استفاده در OpenAI نیاز داشت. در زبان انگلیسی، این مدل با رقبا برابر بود.
عملکرد در متون حقوقی آلمانی:
- Kolibri: ۳۵,۱۹۰ توکن
- o200k_base (GPT-4o/5): ۴۱,۴۸۲ توکن (+۱۷.۹٪)
- Qwen3.5 35B-A3B: ۴۲,۹۰۷ توکن (+۲۱.۹٪)
- Mistral Small 4: ۴۳,۴۷۸ توکن (+۲۳.۶٪)
- Gemma 4: ۴۳,۸۵۰ توکن (+۲۴.۶٪)
عملکرد در متون حقوقی انگلیسی:
- Kolibri: ۳۹,۸۷۵ توکن
- o200k_base (GPT-4o/5): ۳۹,۷۳۷ توکن (-۰.۳٪)
- Qwen3.5 35B-A3B: ۴۱,۶۵۰ توکن (+۴.۵٪)
- Mistral Small 4: ۴۱,۳۰۱ توکن (+۳.۶٪)
- Gemma 4: ۴۱,۵۶۴ توکن (+۴.۲٪)
کاهش توکنها برای کاربر دو معنا دارد: سرعت پردازش بیشتر و جایگیری متن واقعی بیشتری در همان پنجره متنی (Context Window) — شبیه میز کاری که فضای بیشتری برای ورقها دارد.
بستر متنی عظیم و پاسخهای صادقانه
مدل Kolibri بستر متنی بومی ۲۶۲,۱۴۴ توکنی دارد که تا ۱,۰۴۸,۵۷۶ توکن اعتبارسنجی شده است. برای مقرونبهصرفه کردن این حجم، مدل در ۴۰ لایه از ۵۰ لایه خود از «توجه پنجره لغزان» (Sliding-window attention) استفاده میکند که در آن توکنها تنها ۵۱۲ توکن قبلی خود را میبینند. هر لایه پنجم، توجه کامل (Full attention) را برای حفظ انسجام کلی اجرا میکند.
یک جزئیات فنی هوشمندانه در اینجا وجود دارد: تنها لایههای پنجره لغزان از جاسازیهای موقعیتی دورانی (Rotary position embeddings) استفاده میکنند تا جایگاه توکن را بدانند. چون لایههای توجه کامل از این روش استفاده نمیکنند، بستر متنی میتواند بدون ترفندهای موقعیتی اضافی، از حد آموزش فراتر رود. در تست RULER برای بستر طولانی در ۱ میلیون توکن، مدل پایه Kolibri امتیاز ۶۳.۲ را کسب کرد و از امتیاز ۵۸.۵ مدل Nemotron 3 Nano و ۵۷.۵ مدل Qwen3.5 35B-A3B پیشی گرفت.
برای جلوگیری از توهم (Hallucination) — وقتی مدل با اطمینان چیزی میگوید که وجود ندارد — از پروتکل Merlin-Arthur استفاده شده است. این روش آموزشی مانند بازیای با سه بازیکن است:
- آرتور (Arthur): مدلی است که آموزش میبیند. او سوالی را دریافت میکند که بخشهایی از سند پشتیبان آن پنهان شده است.
- مرلین (Merlin): بخشهایی را پنهان میکند تا یافتن پاسخ درست آسانتر شود و آرتور را برای پاسخ به آنها آموزش دهد.
- مورگانا (Morgana): شواهدی را که پاسخ به آنها وابسته است پنهان میکند تا آرتور آموزش ببیند که بگوید «نمیدانم».
چون آرتور نمیداند با کدام بازیکن روبروست، مجبور است واقعاً بررسی کند که آیا شواهد پاسخ را پشتیبانی میکنند یا خیر. در آزمون Omniscience شرکت Artificial Analysis، مدل Kolibri در ۴۴٪ موارد پذیرفت که پاسخ را نمیداند یا پاسخهای ناقص داد، در حالی که این عدد برای Qwen3.5 35B-A3B تنها ۱۱.۱٪ و برای GPT-OSS 120B حدود ۲۳.۷٪ بود. تنها مدل Qwen3.6 35B-A3B با ۵۶.۷٪ عملکرد بهتری داشت.
استدلال بومی و عملکرد
برخلاف بسیاری از مدلها که حتی با پرامپت آلمانی، به انگلیسی «فکر» میکنند، Kolibri بهطور بومی به زبان آلمانی استدلال میکند. Aleph Alpha متوجه شد که مقدار کمی داده استدلال آلمانی در واقع به عملکرد آسیب میزند؛ یک بار امتیازات ریاضی آنها از ۷۰.۲ به ۴۸.۳ افت کرد چون افکار مدل در چرخه میافتادند و هرگز به پایان نمیرسیدند. برای رفع این مشکل، آنها حدود ۸۰۰ هزار نمونه استدلال آلمانی را در پروژهای به نام «عبور از دره اشکها» تولید کردند.
در محکهای ریاضی، Kolibri در کلاس اندازه خود پیشتاز است. این مدل در آزمون AIME 2025 به زبان آلمانی امتیاز ۸۷.۵ را کسب کرد و از Nemotron 3 Nano انویدیا (۸۴.۴) پیشی گرفت. در زبان انگلیسی، امتیاز ۹۶.۹ را در همین تست به دست آورد و تمام مدلهای MoE در مقایسه، از جمله مدلهایی با ۱۲ میلیارد پارامتر فعال را شکست داد. تنها مدل متراکم Qwen3.8 27B امتیاز بالاتری داشت. این رقابت با مدلهای متراکم یادآور عملکرد مدل Qwen3.8-27B علیبابا است که در شاخصهای هوش توانست با مدلهای پیشرفتهای چون GPT-5.6 Luna برابری کند.
نقاط قوت مقایسهای
در ارزیابیهای Aleph Alpha، مدل Kolibri در چندین حوزه کلیدی از رقبای هماندازه خود پیشی میگیرد:
- امتیاز کلی انگلیسی: ۷۵.۵ (در مقابل ۷۴.۷ برای Qwen3.5 35B-A3B)
- امتیاز کلی آلمانی: ۷۰.۸ (در مقابل ۶۹.۸ برای Qwen3.5 35B-A3B)
- اسناد شرکتی دیده نشده (انگلیسی): ۸۹.۷ (در مقابل ۸۷.۰ برای Qwen3.5 35B-A3B)
- بستر طولانی در ۱ میلیون توکن (پایه): ۶۳.۲ (در مقابل ۵۸.۵ برای Nemotron 3 Nano)
تست اسناد شرکتی شامل پنج سناریو بر اساس کارهای مشتریان در زمینههای نیمههادیها، بخش دولتی آلمان، هوافضا، تأمین قطعات خودرو و درایوهای صنعتی است. این تستها روی اسناد و سوالاتی اجرا شدند که مدل هرگز در طول آموزش ندیده بود.
محدودیتها و سختافزار
Kolibri یک دایرهالمعارف عمومی برای پاسخ به هر سوال نیست. این مدل در آزمونهای «کتاب-بسته» (بدون دسترسی به سند) در میان ۱۲ مدل مقایسه شده، رتبه آخر را دارد و در RAG Benchmark بدون سند، امتیاز ۵۱.۰ را کسب کرد. همچنین تنها ۱۴.۸٪ از سوالات Omniscience را درست پاسخ داد (در مقابل ۲۲.۲٪ برای Qwen3.5 35B-A3B). این مدل برای تولید بازیابیافزا (RAG) — شبیه دانشآموزی که قبل از جواب دادن، اول کتاب را باز میکند — طراحی شده است، نه برای بازیابی حقایق از حافظه.
سایر نقاط ضعف عبارتند از:
- برنامهنویسی: امتیاز ۲۷.۷ در Terminal-Bench 2.1 (در برابر ۳۹.۷ برای Qwen3.5 35B-A3B) و امتیاز ۶۶.۴ در SWE-bench Verified در مقابل ۷۳.۸ برای Qwen3.6 35B-A3B.
- فراخوانی ابزار: فراخوانی ابزار در چندین نوبت (Multi-turn) ضعیفتر است و در Berkeley Function Calling امتیاز ۳۹.۸ را کسب کرد، در حالی که GLM-4.7 Flash امتیاز ۵۸.۲ و Qwen3.5 امتیاز ۵۴.۰ داشتند.
- افت بستر متنی: در ۱۲۸,۰۰۰ توکن در تست RULER، امتیاز ۶۷.۹ را میگیرد، در حالی که مدل پایه Qwen3.5 امتیاز ۸۹.۹ دارد. Kolibri تنها در بخشهای بسیار طولانی پیشی میگیرد.
- حافظه: به دلیل نیاز به نگه داشتن تمام ۷۸ میلیارد پارامتر در حافظه، حداقل ۷۸ گیگابایت VRAM در حالت ۸-بیت (FP8) نیاز است. این امر مستلزم حداقل دو کارت NVIDIA A100 یا H100 (هر کدام ۸۰ گیگابایت) یا یک کارت H200، B200 یا B300 است.
استقرار و کاربرد عملی
برای اجرای Kolibri، کاربران باید از پلاگین aleph-alpha-inference برای vLLM (در حال حاضر نسخه ۰.۲۹) استفاده کنند. مدل چهار سطح تلاش برای استدلال (none, low, medium, high) را پشتیبانی میکند تا توسعهدهنده بتواند بین تأخیر (Latency) و عمق پاسخ در هر درخواست تعادل برقرار کند.
استقرار برای بستر کامل یک میلیون توکنی نیازمند فلگهای خاص است:vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}'
برای استقرار استاندارد، دستور به این صورت است:vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --reasoning-parser kolibri1 --tool-call-parser kolibri1 --enable-auto-tool-choice
کارت مدل تنظیمات temperature=1.0 ، top_p=0.97 و top_k=128 را توصیه میکند. برای کارهای حساس به تأخیر، بستر متنی باید زیر ۲۶۲,۱۴۴ توکن نگه داشته شود.
در دنیای واقعی، برای کسانی که در زمینههای به شدت تنظیمشده کار میکنند، مانند پروژه عصبی که در حال حاضر با پروفسور دکتر هاینریش اودبرت در پردیس بنجامین فرانکلین بیمارستان Charité برلین در حال توسعه است، Kolibri راهی برای پردازش محلی دادههای حساس بیماران فراهم میکند. در این پروژه، یک آواتار هوش مصنوعی تستهای اولیه را برای بیماران با شکایات عصبی انجام میدهد تا درجه فوریت را قبل از ملاقات با پزشک عمومی تعیین کند. چون گفتگوها به زبان آلمانی است و دادههای سلامت را شامل میشود، مدل باید روی سختافزار کنترلشده اجرا شود.
این تغییر رویکرد به سمت «عمق به جای وسعت» به این معناست که Kolibri اکثر زبانهای جهانی را نادیده گرفته تا در زبانهای آلمانی و انگلیسی استاد شود. این مدل روی ۲۴ تریلیون توکن — که بیش از یکپنجم آن آلمانی بود — با استفاده از ۷۶۸ پردازنده NVIDIA B200 آموزش دیده است. اگرچه یک مدل متراکم بزرگتر مانند Qwen3.8 27B در امتیازات کلی انگلیسی (۸۰.۲) و آلمانی (۷۹.۹) برتری دارد، اما تقریباً ۸ برابر پارامتر بیشتری را در هر توکن به کار میگیرد. Kolibri ابزاری برای متخصصی است که برای حاکمیت داده، استدلال بومی آلمانی و صداقت در گفتن «نمیدانم» ارزش قائل است.
گام بعدی شما
- اگر روی متون تخصصی آلمانی کار میکنید، مدل را از طریق Hugging Face و با استفاده از vLLM تست کنید.
- برای کاهش هزینه استنتاج، سطح reasoning را روی
lowیاmediumتنظیم کنید. - در استقرار مدل، حتماً از فلگ
--kv-cache-dtype fp8برای مدیریت حافظه استفاده کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو