پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Kolibri مصرف توکن‌های زبان آلمانی را ۱۵٪ کاهش داد

·۱۱ مهر ۱۴۰۵۱۲ دقیقه مطالعه
لوگوی Aleph Alpha Kolibri، مدل زبانی بزرگ آلمانی مستقل.
لوگوی Aleph Alpha Kolibri، مدل زبانی بزرگ آلمانی مستقل.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی توکن‌ساز UniBPE که با کاهش ۱۵ درصدی توکن‌ها در زبان آلمانی، مستقیماً سرعت استنتاج را بالا برده و هزینه پردازش را کم می‌کند.

اگر برای پردازش متون حقوقی یا اداری در محیط‌های حساس کار می‌کنید، هزینه استنتاج شما می‌تواند به‌طور محسوسی کاهش یابد. مدل Kolibri که در ۳ اکتبر ۲۰۲۶ توسط شرکت Aleph Alpha منتشر شد، مصرف توکن‌ها را در زبان آلمانی تا ۱۵٪ کاهش داده است. این مدل یک مدل با وزن‌های باز (Open-weight) از نوع ترکیب خبره‌ها (Mixture of Experts یا MoE) است که به‌طور کامل روی خاک اروپا اجرا می‌شود. Kolibri (به معنای مرغ مگس‌خوار در آلمانی، اشاره‌ای به پروفایل محاسباتی سبک آن) در استدلال‌های مربوط به زبان آلمانی و بازیابی متون با بستر طولانی، از رقبای هم‌اندازه خود پیشی می‌گیرد. این مدل برای ایجاد تعادل میان نوآوری‌های با عملکرد بالا و الزامات سخت‌گیرانه حریم خصوصی داده‌های «قانون هوش مصنوعی اتحادیه اروپا» (EU AI Act) طراحی شده است. فایل‌های پیکربندی و وزن‌های مدل تحت لایسنس Apache 2.0 در Hugging Face در دسترس عموم قرار گرفته است.

این عرضه در حالی رخ می‌دهد که سازمان‌های اروپایی برای تطبیق قدرت مدل‌های پیشرو آمریکایی با قوانین سخت‌گیرانه حاکمیتی دست‌وپنجه نرم می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی استفاده شرکت‌هایی مثل Funding Fit از مدل‌های محلی برای کنترل داده‌ها اشاره کردیم، Kolibri مسیری آماده برای بخش‌هایی فراهم می‌کند که داده‌ها هرگز نباید از محیط سازمان خارج شوند. این مدل به‌طور خاص برای کاربران «حاکمیتی» مانند وزارت‌خانه‌ها، تأمین‌کنندگان قطعات خودرو یا بیمارستان‌ها ساخته شده است که نیازمند آزادی کامل در استقرار و امنیت مالکیت معنوی هستند.

تعریف حاکمیت داده

Aleph Alpha حاکمیت را از دو منظر اصلی تعریف می‌کند:

  • ساختار و ساخت: مدل توسط تیم‌هایی در آلمان و روی زیرساخت‌هایی در آلمان و فنلاند، تحت قوانین اروپا و آلمان و بدون هیچ‌گونه کنترل خارجی ساخته و آموزش دیده است.
  • حقوق مشتری: کاربران آزادی کامل در استقرار و امنیت مالکیت معنوی دارند؛ به این معنا که انطباق با قوانین، یک «ویژگی ارث‌بری شده» در مدل است.

برای تقویت این تعهد، Aleph Alpha «کد رویه هوش مصنوعی با هدف عمومی» (GPAI Code of Practice) اتحادیه اروپا را امضا کرده است. با این حال، حاکمیت به معنای انزوای کامل نیست. در کارت مدل (Model Card) ذکر شده است که متون وب انگلیسی با استفاده از مدل Gemma 4 گوگل و متون آلمانی با استفاده از Mistral-NeMo بازنویسی شده‌اند. همچنین از داده‌های برچسب‌گذاری شده Qwen3-32B برای فیلترهای کیفی استفاده شده است. تیم توسعه‌دهنده به‌طور خاص داده‌های آموزشی را فیلتر کردند تا سوگیری‌های سیاسی که اغلب در مدل‌های باز چینی یافت می‌شود (و خودشان در آن مدل‌ها اندازه‌گیری کرده بودند) را حذف کنند.

معماری بهینه‌سازی شده

مدل Kolibri دارای ۷۸.۱ میلیارد پارامتر است، اما مانند مدل‌های متراکم (Dense) عمل نمی‌کند. این مدل از معماری ترکیب خبره‌ها (MoE) با ۵۰ لایه تشکیل شده است که هر لایه شامل ۳۸۴ متخصص به علاوه یک متخصص مشترک است. برای هر توکن پردازش شده، یک مسیریاب (Router) تنها ۶ متخصص از میان این‌ها را انتخاب می‌کند. این رویکرد در راستای تکامل معماری‌های بهینه است که در مخزن متن‌باز OpenArch، پیاده‌سازی‌های متنوعی از ۷۲ معماری مدرن LLM برای تحلیل و توسعه ارائه شده است.

این یعنی مدل حافظه یک مدل ۷۸ میلیارد پارامتری را می‌طلبد، اما در هر لحظه تنها ۳.۴۶ میلیارد پارامتر (حدود ۴.۴٪ کل) فعال هستند و کار واقعی را انجام می‌دهند. طبق گزارش فنی Aleph Alpha، این سازوکار اجازه می‌دهد هوش مدل در سطح بالا باقی بماند اما هزینه استنتاج (Inference) — یعنی همان لحظه تولید جواب — کمتر از جایگزین‌های متراکم باشد. این کاهش هزینه‌های عملیاتی یادآور رویکرد مدل‌های Smaug است که توانستند هزینه‌های حلقه‌های عامل‌های هوش مصنوعی را تا ۱۰۰ برابر کاهش دهند.

استعاره متخصصان

برای درک بهتر این موضوع، پزشکی را تصور کنید که تمام کتاب‌های پزشکی جهان را خوانده است در مقابل متخصصی در خون‌شناسی (هماتولوژی). اگر شما بیماری خونی داشته باشید، پزشک عمومی ممکن است به دلیل «دانستن بیش از حد» اطلاعات نامرتبط، پاسخ اشتباه بدهد. یک مدل MoE مانند بیمارستانی است که پر از متخصص است و مسیریاب نقش پذیرش را دارد که توکن را به ۶ متخصص درست می‌فرستد.

دو نکته مهم در این استعاره وجود دارد:

  • الگو-محور، نه موضوع-محور: متخصصان بر اساس موضوعاتی مثل «حقوق آلمان» تقسیم نشده‌اند؛ بلکه معمولاً الگوهای توکنی مانند علائم نگارشی یا اسامی خاص را مدیریت می‌کنند.
  • سربار حافظه: بیمارستان باید تمام ۳۸۴ متخصص را در کادر خود نگه دارد، حتی اگر در هر لحظه فقط ۶ نفر دیده شوند. همان‌طور که در کارت مدل آمده است: «کل مدل باید در حافظه نگه داشته شود، حتی اگر در هر لحظه تنها بخشی از آن فعال باشد».

حل شکاف زبانی آلمانی

بزرگ‌ترین دستاورد Kolibri در توکن‌سازی (Tokenization) — یعنی تبدیل متن به تکه‌های کوچک شبیه برش‌های کیک که مدل آن‌ها را می‌خورد — نهفته است. اکثر مدل‌ها با توکن‌سازهای انگلیسی آموزش دیده‌اند که کلمات ترکیبی پیچیده آلمانی را به تکه‌های کوچک و ناکارآمد خرد می‌کنند. برای مثال، نام دادگاه قانون اساسی فدرال در توکن‌ساز o200k_base به ۶ توکن تقسیم می‌شود (Bund | es | ver | fass | ungs | gericht)، اما در Kolibri تنها به ۲ توکن تبدیل می‌شود (Bundes | verfassungsgericht).

این شرکت الگوریتمی به نام UniBPE توسعه داده است. این توکن‌ساز ادغام پایین به بالای کدگذاری جفت-بایت (BPE) را حفظ می‌کند اما هر ادغام را با یک قانون امتیازدهی متفاوت (هدف Unigram) انتخاب می‌کند تا نحوه ساخت کلمات در زبان آلمانی را رعایت کند. این منجر به کاهش ۱۱.۲ درصدی توکن‌ها برای متون عمومی آلمانی در مقایسه با GPT-5 شده است.

بنچمارک‌های توکن‌سازی

در آزمونی خاص روی قانون اساسی جمهوری فدرال آلمان (۱۸۵ کیلوبایت متن حقوقی)، Kolibri به ۱۵٪ توکن کمتری نسبت به توکن‌ساز o200k_base مورد استفاده در OpenAI نیاز داشت. در زبان انگلیسی، این مدل با رقبا برابر بود.

  • عملکرد در متون حقوقی آلمانی:

    • Kolibri: ۳۵,۱۹۰ توکن
    • o200k_base (GPT-4o/5): ۴۱,۴۸۲ توکن (+۱۷.۹٪)
    • Qwen3.5 35B-A3B: ۴۲,۹۰۷ توکن (+۲۱.۹٪)
    • Mistral Small 4: ۴۳,۴۷۸ توکن (+۲۳.۶٪)
    • Gemma 4: ۴۳,۸۵۰ توکن (+۲۴.۶٪)
  • عملکرد در متون حقوقی انگلیسی:

    • Kolibri: ۳۹,۸۷۵ توکن
    • o200k_base (GPT-4o/5): ۳۹,۷۳۷ توکن (-۰.۳٪)
    • Qwen3.5 35B-A3B: ۴۱,۶۵۰ توکن (+۴.۵٪)
    • Mistral Small 4: ۴۱,۳۰۱ توکن (+۳.۶٪)
    • Gemma 4: ۴۱,۵۶۴ توکن (+۴.۲٪)

کاهش توکن‌ها برای کاربر دو معنا دارد: سرعت پردازش بیشتر و جایگیری متن واقعی بیشتری در همان پنجره متنی (Context Window) — شبیه میز کاری که فضای بیشتری برای ورق‌ها دارد.

بستر متنی عظیم و پاسخ‌های صادقانه

مدل Kolibri بستر متنی بومی ۲۶۲,۱۴۴ توکنی دارد که تا ۱,۰۴۸,۵۷۶ توکن اعتبارسنجی شده است. برای مقرون‌به‌صرفه کردن این حجم، مدل در ۴۰ لایه از ۵۰ لایه خود از «توجه پنجره لغزان» (Sliding-window attention) استفاده می‌کند که در آن توکن‌ها تنها ۵۱۲ توکن قبلی خود را می‌بینند. هر لایه پنجم، توجه کامل (Full attention) را برای حفظ انسجام کلی اجرا می‌کند.

یک جزئیات فنی هوشمندانه در اینجا وجود دارد: تنها لایه‌های پنجره لغزان از جاسازی‌های موقعیتی دورانی (Rotary position embeddings) استفاده می‌کنند تا جایگاه توکن را بدانند. چون لایه‌های توجه کامل از این روش استفاده نمی‌کنند، بستر متنی می‌تواند بدون ترفندهای موقعیتی اضافی، از حد آموزش فراتر رود. در تست RULER برای بستر طولانی در ۱ میلیون توکن، مدل پایه Kolibri امتیاز ۶۳.۲ را کسب کرد و از امتیاز ۵۸.۵ مدل Nemotron 3 Nano و ۵۷.۵ مدل Qwen3.5 35B-A3B پیشی گرفت.

برای جلوگیری از توهم (Hallucination) — وقتی مدل با اطمینان چیزی می‌گوید که وجود ندارد — از پروتکل Merlin-Arthur استفاده شده است. این روش آموزشی مانند بازی‌ای با سه بازیکن است:

  • آرتور (Arthur): مدلی است که آموزش می‌بیند. او سوالی را دریافت می‌کند که بخش‌هایی از سند پشتیبان آن پنهان شده است.
  • مرلین (Merlin): بخش‌هایی را پنهان می‌کند تا یافتن پاسخ درست آسان‌تر شود و آرتور را برای پاسخ به آن‌ها آموزش دهد.
  • مورگانا (Morgana): شواهدی را که پاسخ به آن‌ها وابسته است پنهان می‌کند تا آرتور آموزش ببیند که بگوید «نمی‌دانم».

چون آرتور نمی‌داند با کدام بازیکن روبروست، مجبور است واقعاً بررسی کند که آیا شواهد پاسخ را پشتیبانی می‌کنند یا خیر. در آزمون Omniscience شرکت Artificial Analysis، مدل Kolibri در ۴۴٪ موارد پذیرفت که پاسخ را نمی‌داند یا پاسخ‌های ناقص داد، در حالی که این عدد برای Qwen3.5 35B-A3B تنها ۱۱.۱٪ و برای GPT-OSS 120B حدود ۲۳.۷٪ بود. تنها مدل Qwen3.6 35B-A3B با ۵۶.۷٪ عملکرد بهتری داشت.

استدلال بومی و عملکرد

برخلاف بسیاری از مدل‌ها که حتی با پرامپت آلمانی، به انگلیسی «فکر» می‌کنند، Kolibri به‌طور بومی به زبان آلمانی استدلال می‌کند. Aleph Alpha متوجه شد که مقدار کمی داده استدلال آلمانی در واقع به عملکرد آسیب می‌زند؛ یک بار امتیازات ریاضی آن‌ها از ۷۰.۲ به ۴۸.۳ افت کرد چون افکار مدل در چرخه می‌افتادند و هرگز به پایان نمی‌رسیدند. برای رفع این مشکل، آن‌ها حدود ۸۰۰ هزار نمونه استدلال آلمانی را در پروژه‌ای به نام «عبور از دره اشک‌ها» تولید کردند.

در محک‌های ریاضی، Kolibri در کلاس اندازه خود پیشتاز است. این مدل در آزمون AIME 2025 به زبان آلمانی امتیاز ۸۷.۵ را کسب کرد و از Nemotron 3 Nano انویدیا (۸۴.۴) پیشی گرفت. در زبان انگلیسی، امتیاز ۹۶.۹ را در همین تست به دست آورد و تمام مدل‌های MoE در مقایسه، از جمله مدل‌هایی با ۱۲ میلیارد پارامتر فعال را شکست داد. تنها مدل متراکم Qwen3.8 27B امتیاز بالاتری داشت. این رقابت با مدل‌های متراکم یادآور عملکرد مدل Qwen3.8-27B علی‌بابا است که در شاخص‌های هوش توانست با مدل‌های پیشرفته‌ای چون GPT-5.6 Luna برابری کند.

نقاط قوت مقایسه‌ای

در ارزیابی‌های Aleph Alpha، مدل Kolibri در چندین حوزه کلیدی از رقبای هم‌اندازه خود پیشی می‌گیرد:

  • امتیاز کلی انگلیسی: ۷۵.۵ (در مقابل ۷۴.۷ برای Qwen3.5 35B-A3B)
  • امتیاز کلی آلمانی: ۷۰.۸ (در مقابل ۶۹.۸ برای Qwen3.5 35B-A3B)
  • اسناد شرکتی دیده نشده (انگلیسی): ۸۹.۷ (در مقابل ۸۷.۰ برای Qwen3.5 35B-A3B)
  • بستر طولانی در ۱ میلیون توکن (پایه): ۶۳.۲ (در مقابل ۵۸.۵ برای Nemotron 3 Nano)

تست اسناد شرکتی شامل پنج سناریو بر اساس کارهای مشتریان در زمینه‌های نیمه‌هادی‌ها، بخش دولتی آلمان، هوافضا، تأمین قطعات خودرو و درایوهای صنعتی است. این تست‌ها روی اسناد و سوالاتی اجرا شدند که مدل هرگز در طول آموزش ندیده بود.

محدودیت‌ها و سخت‌افزار

Kolibri یک دایره‌المعارف عمومی برای پاسخ به هر سوال نیست. این مدل در آزمون‌های «کتاب-بسته» (بدون دسترسی به سند) در میان ۱۲ مدل مقایسه شده، رتبه آخر را دارد و در RAG Benchmark بدون سند، امتیاز ۵۱.۰ را کسب کرد. همچنین تنها ۱۴.۸٪ از سوالات Omniscience را درست پاسخ داد (در مقابل ۲۲.۲٪ برای Qwen3.5 35B-A3B). این مدل برای تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب را باز می‌کند — طراحی شده است، نه برای بازیابی حقایق از حافظه.

سایر نقاط ضعف عبارتند از:

  • برنامه‌نویسی: امتیاز ۲۷.۷ در Terminal-Bench 2.1 (در برابر ۳۹.۷ برای Qwen3.5 35B-A3B) و امتیاز ۶۶.۴ در SWE-bench Verified در مقابل ۷۳.۸ برای Qwen3.6 35B-A3B.
  • فراخوانی ابزار: فراخوانی ابزار در چندین نوبت (Multi-turn) ضعیف‌تر است و در Berkeley Function Calling امتیاز ۳۹.۸ را کسب کرد، در حالی که GLM-4.7 Flash امتیاز ۵۸.۲ و Qwen3.5 امتیاز ۵۴.۰ داشتند.
  • افت بستر متنی: در ۱۲۸,۰۰۰ توکن در تست RULER، امتیاز ۶۷.۹ را می‌گیرد، در حالی که مدل پایه Qwen3.5 امتیاز ۸۹.۹ دارد. Kolibri تنها در بخش‌های بسیار طولانی پیشی می‌گیرد.
  • حافظه: به دلیل نیاز به نگه داشتن تمام ۷۸ میلیارد پارامتر در حافظه، حداقل ۷۸ گیگابایت VRAM در حالت ۸-بیت (FP8) نیاز است. این امر مستلزم حداقل دو کارت NVIDIA A100 یا H100 (هر کدام ۸۰ گیگابایت) یا یک کارت H200، B200 یا B300 است.

استقرار و کاربرد عملی

برای اجرای Kolibri، کاربران باید از پلاگین aleph-alpha-inference برای vLLM (در حال حاضر نسخه ۰.۲۹) استفاده کنند. مدل چهار سطح تلاش برای استدلال (none, low, medium, high) را پشتیبانی می‌کند تا توسعه‌دهنده بتواند بین تأخیر (Latency) و عمق پاسخ در هر درخواست تعادل برقرار کند.

استقرار برای بستر کامل یک میلیون توکنی نیازمند فلگ‌های خاص است:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}'

برای استقرار استاندارد، دستور به این صورت است:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --reasoning-parser kolibri1 --tool-call-parser kolibri1 --enable-auto-tool-choice

کارت مدل تنظیمات temperature=1.0 ، top_p=0.97 و top_k=128 را توصیه می‌کند. برای کارهای حساس به تأخیر، بستر متنی باید زیر ۲۶۲,۱۴۴ توکن نگه داشته شود.

در دنیای واقعی، برای کسانی که در زمینه‌های به شدت تنظیم‌شده کار می‌کنند، مانند پروژه عصبی که در حال حاضر با پروفسور دکتر هاینریش اودبرت در پردیس بنجامین فرانکلین بیمارستان Charité برلین در حال توسعه است، Kolibri راهی برای پردازش محلی داده‌های حساس بیماران فراهم می‌کند. در این پروژه، یک آواتار هوش مصنوعی تست‌های اولیه را برای بیماران با شکایات عصبی انجام می‌دهد تا درجه فوریت را قبل از ملاقات با پزشک عمومی تعیین کند. چون گفتگوها به زبان آلمانی است و داده‌های سلامت را شامل می‌شود، مدل باید روی سخت‌افزار کنترل‌شده اجرا شود.

این تغییر رویکرد به سمت «عمق به جای وسعت» به این معناست که Kolibri اکثر زبان‌های جهانی را نادیده گرفته تا در زبان‌های آلمانی و انگلیسی استاد شود. این مدل روی ۲۴ تریلیون توکن — که بیش از یک‌پنجم آن آلمانی بود — با استفاده از ۷۶۸ پردازنده NVIDIA B200 آموزش دیده است. اگرچه یک مدل متراکم بزرگتر مانند Qwen3.8 27B در امتیازات کلی انگلیسی (۸۰.۲) و آلمانی (۷۹.۹) برتری دارد، اما تقریباً ۸ برابر پارامتر بیشتری را در هر توکن به کار می‌گیرد. Kolibri ابزاری برای متخصصی است که برای حاکمیت داده، استدلال بومی آلمانی و صداقت در گفتن «نمی‌دانم» ارزش قائل است.

گام بعدی شما

  • اگر روی متون تخصصی آلمانی کار می‌کنید، مدل را از طریق Hugging Face و با استفاده از vLLM تست کنید.
  • برای کاهش هزینه استنتاج، سطح reasoning را روی low یا medium تنظیم کنید.
  • در استقرار مدل، حتماً از فلگ --kv-cache-dtype fp8 برای مدیریت حافظه استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با ترکیب معماری MoE و توکن‌سازی تخصصی، استانداردی جدید برای هوش مصنوعی حاکمیتی در اروپا ایجاد می‌کند. تخصص Aleph Alpha در بهینه‌سازی زبان‌های غیرانگلیسی، هزینه عملیاتی مدل‌های زبانی را برای سازمان‌های بزرگ کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل لایسنس Apache 2.0، توسعه‌دهندگان ایرانی می‌توانند از معماری UniBPE برای بهینه‌سازی توکن‌سازی زبان فارسی الگو بگیرند تا مصرف توکن‌ها در مدل‌های فارسی کاهش یابد.

·نگاه ما
تحریریه دات‌هوش

تمرکز Aleph Alpha بر «صداقت» به‌جای «دانستگی» یک چرخش راهبردی است. در حالی که اکثر شرکت‌ها سعی می‌کنند مدل‌هایی بسازند که هر سوالی را جواب دهند، Kolibri با پذیرش نادانی (I don't know)، اعتمادپذیری را در محیط‌های صنعتی و پزشکی بالا می‌برد. این مدل ثابت می‌کند که برای کاربردهای سازمانی، کاهش نرخ توهم بسیار ارزشمندتر از داشتن یک مدل با دانش عمومی گسترده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.