پرش به محتوای اصلی
پرش به محتوای مقاله

خطای «وارونگی انگلیسی»؛ دلیل شکست پرامپت‌های عمومی در بومی‌سازی فرانسوی کبک

·۲۴ مرداد ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
راهنما
مشکل دریافت لهجه کبک به جای فرانسه استاندارد از هوش مصنوعی
مشکل دریافت لهجه کبک به جای فرانسه استاندارد از هوش مصنوعی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شناسایی پدیده «وارونگی انگلیسی» در مدل‌های AI؛ یعنی مدل‌ها به‌اشتباه تصور می‌کنند نسخه‌های محلی زبان‌ها (مثل فرانسوی کبک) انگلیسی‌تر از نسخه‌های استاندارد هستند، در حالی که در نوشتار رسمی دقیقاً عکس این موضوع صادق است.

اگر برای بازار کبک محصولی توسعه می‌دهید، احتمالاً متوجه شده‌اید که خروجی‌های هوش مصنوعی شما برای کاربران محلی «عجیب» یا «بیش از حد فرانسوی» است. این اتفاق به دلیل یک سوءتفاهم بنیادین در داده‌های آموزشی مدل‌ها رخ می‌دهد: مدل‌ها تصور می‌کنند فرانسوی کبک نسخه‌ای ساده‌شده و آمیخته به انگلیسی است، اما در واقعیت، نوشتار رسمی این منطقه سخت‌گیرانه‌ترین استانداردها را برای حذف کلمات انگلیسی دارد.

یک پرامپت کلی برای زبان «فرانسوی» تقریباً همیشه خروجی را به صورت فرانسوی متپولیتان (فرانسه) تولید می‌کند، زیرا کشور فرانسه بر روی مجموعه داده‌های آموزشی وب تسلط دارد. این موضوع باعث ایجاد یک شکست در بومی‌سازی برای توسعه‌دهندگانی می‌شود که بازار کبک را هدف قرار داده‌اند؛ جایی که فرانسوی مکتوب رسمی به‌طور سیستماتیک در برابر وام‌واژه‌های انگلیسی مقاوم‌تر از گونه‌ای است که در فرانسه صحبت می‌شود. این مکانیزم سهم داده‌ها مشابه روشی است که زبان پرتغالی به‌طور پیش‌فرض به یک گونه خاص متمایل می‌شود، اما در این مورد، گونه غیرپیش‌فرض دارای یک استاندارد منتشر شده است که می‌توانید نام آن را ذکر کنید.

بومی‌سازی برای بازار کبک صرفاً به معنای افزودن کلمات عامیانه نیست، بلکه درباره پایبندی به یک سیاست زبانی سخت‌گیرانه است. برای پنجاه سال است که دفتر زبان فرانسوی کبک (Office québécois de la langue française یا OQLF) جایگزین‌های فرانسوی را برای اصطلاحات انگلیسی ابداع کرده است تا از زبان در محیط آمریکای شمالی محافظت کند. OQLF اصطلاحات و راهنمای استفاده خود را از طریق Vitrine linguistique منتشر می‌کند. در حالی که فرانسوی فرانسه به‌راحتی اصطلاحاتی مانند "email"، "shopping"، "parking"، "week-end"، "chat" و "spam" را می‌پذیرد، استاندارد رسمی کبک جایگزین‌هایی مانند "courriel" و "magasinage" را الزامی می‌کند.

به گزارش dev.to در راهنمای فنی منتشر شده در ۱۵ اوت ۲۰۲۶، بحرانی‌ترین خطا در تولید محتوای AI، «وارونگی انگلیسی» (Anglicism Inversion) است. مدل‌ها اغلب فرض می‌کنند که فرانسوی کبک بیشتر تحت تأثیر انگلیسی است، در حالی که در زمینه‌های حرفه‌ای، دقیقاً عکس این موضوع صادق است. در حالی که فرانسوی گفتاری و عامیانه در کبک حاوی انگلیسی‌گرایی‌های متمایزی است، فرانسوی مکتوب رسمی کبک — که همان چیزی است که در یک محصول، سند یا پیام پشتیبانی استفاده می‌شود — به‌طور سیستماتیک فرانسوی‌تر از فرانسوی فرانسه است.

تغییرات کلیدی در واژگان

برای اینکه متن شما «کهنه» یا «غیرطبیعی» به نظر نرسد، توسعه‌دهندگان باید جایگزینی‌های خاصی را اجبار کنند. واژه courriel نمادین‌ترین مورد است؛ این کلمه ابداع OQLF بود و در نوشتارهای دولتی و تجاری کبک استاندارد است. حضور یا عدم حضور این کلمه در یک نگاه به خواننده می‌گوید که متن در کدام گونه زبانی است.

  • ارتباطات دیجیتال: استفاده از courriel به‌جای e-mail/mail، clavardage به‌جای chat/tchat، pourriel به‌جای spam و télécharger برای دانلود.
  • زندگی روزمره: استفاده از stationnement برای پارکینگ، fin de semaine برای week-end، balado برای پادکست و traversier برای کشتی لندینگ (ferry).
  • خرده‌فروشی و زیرساخت: استفاده از magasinage به‌جای shopping، dépanneur برای فروشگاه‌های کوچک (به‌جای supérette/épicerie) و عبارت ARRÊT STOP برای تابلوهای ایست.
  • پوشاک و اشیاء: استفاده از chandail به‌جای pull برای پلیور و téléphone intelligent به‌جای smartphone.
  • عامیات: توجه داشته باشید که در فرانسوی گفتاری کبک از char برای ماشین استفاده می‌شود، در حالی که در فرانسه bagnole رایج است.

باگ زمان‌بندی وعده‌های غذایی

یکی از خطرناک‌ترین خطاها، تغییر در نام وعده‌های غذایی است. این یک تغییر در معناست و نه صرفاً یک جایگزینی ساده. در فرانسه، توالی به این صورت است: petit-déjeuner (صبحانه)، déjeuner (ناهار) و dîner (شام). اما در کبک، توالی به این شکل تغییر می‌کند: déjeuner (صبحانه)، dîner (ناهار) و souper (شام).

بنابراین کلمه dîner در کبک به معنای ظهر و در فرانسه به معنای شب است. این یک تفاوت استایلی ساده نیست، بلکه یک «باگ زمان‌بندی» است که در هر اپلیکیشنی که به زمان وعده‌های غذایی اشاره می‌کند، منتظر وقوع است.

تایپوگرافی و قالب‌بندی

نشانه‌های بصری اغلب بیشتر از خود کلمات، منشأ AI را لو می‌دهند. این‌ها جزئیات کوچک و بسیار مشهودی هستند که هیچ پرامپتی آن‌ها را تولید نمی‌کند مگر اینکه صراحتاً خواسته شود.

  • فاصله‌گذاری علائم: فرانسوی فرانسه قبل از علائم ; : ! ? و داخل گیومه « » یک فاصله (non-breaking space) قرار می‌دهد. طبق مستندات OQLF، کنوانسیون کبک فاصله قبل از دو-نقطه (:) را حفظ می‌کند اما به‌طور کلی آن را قبل از نقطه-ویرگول، علامت تعجب و علامت سؤال حذف می‌کند. متنی که بنویسد "Bonjour !" فوراً به عنوان فرانسوی فرانسه شناسایی می‌شود، در حالی که "Bonjour!" با استانداردهای کبک هم‌راستا است.
  • اعداد و ارز: هر دو منطقه از فاصله برای جداکننده هزارگان و کاما برای اعشار استفاده می‌کنند. با این حال، کبک به‌دلیل تأثیر آمریکای شمالی، در برخی زمینه‌های مالی و فنی نقطه اعشار را مجاز می‌داند. دلار کانادا به صورت «12,50 $» نوشته می‌شود (نماد بعد از مبلغ)، که دقیقاً برعکس کاربرد انگلیسی در کانادا است.
  • تاریخ: کاربرد رسمی کانادایی در زمینه‌های اداری فرمت YYYY-MM-DD را ترجیح می‌دهد که با فرمت DD/MM/YYYY در فرانسه متفاوت است. توسعه‌دهندگان باید فرمت را صراحتاً بیان کنند و به locale اعتماد نکنند.

جنسیت و سطح زبان

کبک زودتر و کامل‌تر از فرانسه، عناوین شغلی مؤنث را پذیرفت. واژگانی مثل professeure، auteure، écrivaine، ingénieure و docteure در کبک کاربردهای استاندارد و عادی هستند، در حالی که در فرانسه برای مدت بسیار طولانی‌تری مورد مناقشه بودند. استفاده از فرم‌های مذکر برای زنان نام‌برده در یک محصول متوجه کبک، قدیمی به نظر می‌رسد.

این موضوع جدا از مسئله گسترده‌تر جنسیت دستوری برای ارجاعات ناشناخته یا گروه‌های مختلط است. در مورد سطح زبان (Register)، در حالی که هر دو منطقه برای رسمیت از vous استفاده می‌کنند، نوشتار تجاری کبک در زمینه‌های مشتری‌محور، سریع‌تر به ضمیر غیررسمی tu منتقل می‌شود.

رویه پیاده‌سازی

برای توسعه‌دهندگان، راه حل فراتر رفتن از تگ‌های locale مانند fr-CA است. مؤثرترین استراتژی این است که بر اساس مکان و مرجع درخواست کنید: «به زبان فرانسوی کبک (fr-CA) و با پیروی از واژگان دفتر زبان فرانسوی کبک (OQLF) بنویس». نام بردن از OQLF سیگنال قوی‌تری است زیرا نام این مؤسسه در داده‌های آموزشی با واژگان صحیح هم‌رخداد است.

توسعه‌دهندگان همچنین باید:

  1. قانون انگلیسی‌گرایی را صراحتاً بیان کنند: «واژگان فرانسوی را بر وام‌واژه‌های انگلیسی ترجیح بده: courriel نه email، clavardage نه chat، pourriel نه spam، stationnement نه parking، fin de semaine نه week-end».
  2. علائم نگارشی را مشخص کنند: «قبل از ! ? یا ; فاصله نگذار. فاصله قبل از : را حفظ کن».
  3. اگر اپلیکیشن با برنامه‌ریزی زمانی سر و کار دارد، واژگان وعده‌های غذایی را صراحتاً مدیریت کند.
  4. یک پاراگراف متن نمونه به زبان فرانسوی کبک ارائه دهد تا مدل را لنگر (anchor) کند.

در نهایت، بررسی را به‌صورت مکانیکی انجام دهید. از Grep برای جستجوی "e-mail"، "email"، "week-end"، "parking"، "shopping" یا وجود فاصله قبل از "!" یا "?" استفاده کنید. همه این‌ها نشانگرهای بدون ابهام فرانسوی فرانسه هستند و بررسی آن‌ها در هر بار تولید محتوا ارزان و سریع است.

یک هشدار: فرانسوی کبک به‌طور کلی همان «فرانسوی کانادایی» نیست. فرانسوی آکادین در نیوبرانزویک و فرانسوی انتاریو و منیتوبا کاربردهای خاص خود را دارند. تگ fr-CA همه این‌ها را در یک دسته قرار می‌دهد. اگر مخاطب شما به‌طور خاص آکادین است، مجموعه داده‌های مکتوب به‌قدری کم است که مدل ممکن است به‌سختی این گونه را بشناسد.

گام بعدی شما

  • به‌جای استفاده از تگ‌های کلی مثل fr-CA، در پرامپت خود صراحتاً بنویسید: «با رعایت واژگان دفتر زبان فرانسوی کبک (OQLF) بنویس».
  • قوانین حذف وام‌واژه‌های انگلیسی را لیست کنید (مثلاً: courriel به‌جای email).
  • دستورالعمل فاصله‌گذاری علائم نگارشی (حذف فاصله قبل از ! و ؟) را به پرامپت سیستمی اضافه کنید.
  • اگر اپلیکیشن شما با زمان‌بندی سر و کار دارد، واژگان وعده‌های غذایی را به‌صورت دستی تعریف کنید.

اما این چالش‌ها تنها بخشی از پیچیدگی‌های بومی‌سازی است؛ برای درک اینکه چگونه مدل‌های زبانی با گویش‌های اقلیت برخورد می‌کنند، تحلیل ما درباره‌ی «ناپدید شدن زبان‌های کم‌منبع» را بخوانید.

چرا این موضوع مهم است؟

این موضوع نشان می‌دهد که بومی‌سازی (Localization) با ترجمه متفاوت است و نادیده گرفتن استانداردهای نهادهای زبانی می‌تواند اعتبار برند را در بازارهای حساس تخریب کند. تخصص در مهندسی پرامپت اکنون نیازمند دانش زبان‌شناسی کاربردی است تا از خطاهای فرهنگی جلوگیری شود.

تأثیر برای ایران

این تحلیل برای توسعه‌دهندگان ایرانی که محصولات خود را برای بازارهای جهانی (به‌ویژه کانادا) بومی‌سازی می‌کنند، یک راهنمای عملی برای جلوگیری از خطاهای رایج در پرامپت‌نویسی است.

·نگاه ما
تحریریه دات‌هوش

این مورد نشان می‌دهد که تگ‌های Locale (مانند fr-CA) برای مدل‌های زبانی بزرگ صرفاً یک راهنمای کلی هستند و نه یک دستورالعمل دقیق. برای بومی‌سازی واقعی، توسعه‌دهندگان باید از «ارجاع به مرجع» (Authority Referencing) استفاده کنند؛ یعنی به‌جای نام بردن از یک کشور، نام نهاد استانداردزاری مثل OQLF را در پرامپت بگنجانند تا مدل را به بخش‌های خاص‌تری از داده‌های آموزشی‌اش هدایت کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.