پرش به محتوای اصلی
پرش به محتوای مقاله

«تبدیل رویدادهای سیستم‌عامل به داده‌های ساخت‌یافته»؛ هدف جدید Screenpipe

·۱ مرداد ۱۴۰۵۵ دقیقه مطالعه
اسکرین‌پایپ: ضبط ۲۴ ساعته صفحه نمایش برای تقویت عوامل هوشمند شما
اسکرین‌پایپ: ضبط ۲۴ ساعته صفحه نمایش برای تقویت عوامل هوشمند شما
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل سیستم‌عامل به یک منبع RAG محلی از طریق ضبط رویداد-محور (به جای OCR مداوم)؛ این کار اجازه می‌دهد حافظه بلندمدت عامل بدون فشار به سخت‌افزار و نقض حریم خصوصی ایجاد شود.

تصور کنید یک حافظه دائمی برای عامل‌های هوش مصنوعی داشته باشید که از جریان ضبط‌شده‌ی تمام فعالیت‌های دیجیتال شما تغذیه می‌شود. اگر هنوز برای دادنِ زمینه به مدل‌ها از کپی-پیست دستی استفاده می‌کنید، باید بدانید عصر «پرامپت‌نویسی دستی» برای انتقالِ بسترِ کاری در حال پایان است.

پروژه‌ی Screenpipe که در سال ۲۰۲۴ توسط توسعه‌دهنده‌ای به نام Louis عرضه شد، تمام پیکسل‌ها و صداهای کامپیوتر شما را ثبت می‌کند تا نیاز به تعویض مداوم زمینه (Context Switching) و نوشتن پرامپت‌های طولانی را از بین ببرد.

این ابزار در واقع یک تولید بازیابی‌افزا (RAG) — شبیه دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — در مقیاس کل سیستم‌عامل است. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، مدیریت داده‌های حساس در سطح محلی، کلید پذیرش این فناوری‌هاست.

زمینه و تکامل

به نقل از مستندات پروژه، این ابزار حاصل یک وسواس بلندمدت روی مفهوم «مغز دوم» است. Louis از سال ۲۰۲۰ سیستم‌های شخصی پیچیده‌ای را برای ذخیره ژورنال‌ها، یادداشت‌های دست‌نویس، موسیقی‌ها، پروژه‌ها، گفتگوها و یک CRM شخصی مدیریت می‌کرد. این مسیر شامل آزمایش‌های گسترده با نسخه‌های اولیه RAG با استفاده از ParlAI، آموزش صدها مدل تنظیم‌شده‌ی GPT2 و در نهایت کار با GPT3 بود.

این سفر آزمون و خطا منجر به خلق Ava شد که نخستین پلاگین هوش مصنوعی برای Obsidian بود و به‌سرعت هزاران کاربر جذب کرد. این تکامل در نهایت به Embedbase رسید؛ یک API طراحی‌شده برای ساده‌سازی ساخت اپلیکیشن‌های هوش مصنوعی که قدرت خود را از RAG می‌گیرند. در طول این فرآیند، Louis به این نتیجه رسید که مدل‌ها برای اینکه واقعاً عملکرد مفیدی داشته باشند، به زمینه‌ی عمیقی از فعالیت‌های لحظه‌ای کاربر در محیط کامپیوتر نیاز دارند.

گذار به سمت خودمختاری

بر اساس گزارش‌های فنی، اکثر ابزارهای هوش مصنوعی امروزی در سیلوهای جداگانه عمل می‌کنند و شما را مجبور می‌کنند داده‌ها را کپی-پیست کنید یا از پلاگین‌های شکننده برای دادنِ زمینه به مدل استفاده کنید. صنعت برای حل این مشکل مسیرهای مختلفی را رفت: تنظیم دقیق (Fine-tuning) — مثل وقتی به یک پزشک عمومی تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — که برای کاربر نهایی بسیار دشوار و دردناک بود، یا استفاده از «فراخوانی ابزار» (Tool-calling) که همچنان نیاز به مدیریت خرد و دستی زیادی داشت. همچنین پروتکل زمینهٔ مدل (MCP) معرفی شد، اما برای کاربران غیرفنی بیش از حد ایستا و پیچیده به نظر می‌رسید.

اخیراً الگوهایی مانند ویکی‌های مدیریت‌شده توسط LLM (به سبک Andrej Karpathy) یا GBrain اثر Garry ظاهر شده‌اند که در آن‌ها عامل‌ها مجموعه‌ای دائمی از صفحات Markdown را نگه می‌دارند. اگرچه این روش‌ها مؤثر هستند، اما هنوز نیاز دارند تا یک انسان به‌صورت دستی منابع را انتخاب و وارد کند. Screenpipe قصد دارد این فرآیند را کاملاً خودکار کند تا هوش مصنوعی بداند کاربر و شرکت او هر روز در تمام اپلیکیشن‌ها چه می‌کنند، نه اینکه فقط محدود به یک ابزار خاص باشد.

برخلاف ضبط‌کننده‌های ساده که با اجرای مداوم نویسه‌خوانی نوری (OCR) روی تک‌تک فریم‌ها باعث مصرف شدید CPU و داغ شدن سیستم می‌شوند (که عملاً کامپیوتر را به یک بخاری تبدیل می‌کند)، Screenpipe از یک معماری رویداد-محور استفاده می‌کند. طبق اعلام توسعه‌دهنده، پس از بحث‌های سال ۲۰۲۴ در Hacker News که نگرانی‌هایی را درباره رضایت برای ضبط، امنیت محلی و نسبت سیگنال به نویز مطرح کرد، سیستم به‌گونه‌ای اصلاح شد که فقط سیگنال‌های خاص سیستم‌عامل را گوش دهد:

  • تغییر اپلیکیشن‌ها و کلیک‌ها
  • مکث‌های تایپی و اسکرول کردن
  • حالت‌های بازگشت به بیکاری (Idle fallbacks)

جزئیات و پیاده‌سازی فنی

وقتی یک تغییر معنادار رخ می‌دهد، برنامه یک اسکرین‌شات را با «درخت دسترسی» (Accessibility Tree) سیستم‌عامل در همان برچسب زمانی دقیق جفت می‌کند. OCR تنها زمانی به عنوان راهکار جایگزین (Fallback) استفاده می‌شود که داده‌های ساختاریافته‌ی دسترسی در دسترس نباشند. صداها نیز به‌صورت مداوم ضبط شده، گویندگان را شناسایی کرده و به‌صورت محلی از طریق مدل‌های Parakeet/Whisper (یا مدل‌های ابری) به متن تبدیل می‌شوند.

زیرساخت فنی این ابزار به شرح زیر است:

  • ذخیره‌سازی داده‌ها: همه چیز در یک پایگاه‌داده SQLite محلی، فایل‌های mp4 و گاهی فایل‌های md ایندکس و ذخیره می‌شود.
  • اتصالات: یک API سازگار با هوش مصنوعی روی پورت ۳۰۳۰ برای عامل‌ها باز است که دارای سیستم احراز هویت، MCP و مهارت‌ها (Skills) است.
  • پشته فنی (Tech Stack): کدها عمدتاً با زبان Rust، MLX و Onnx نوشته شده‌اند. برای تعامل با APIهای اپل از cidre یا فراخوانی‌های مستقیم C و برای ویندوز از windows-rs استفاده شده است. پشتیبانی از لینوکس نیز در مراحل آزمایشی است.

حریم خصوصی از طریق یک مدل محلی شناسایی اطلاعات حساس (PII) که روی Apple MLX یا Windows DirectML اجرا می‌شود، مدیریت می‌گردد. این اطمینان می‌دهد که اطلاعات حساس پیش از رسیدن به هرگونه مدل ابری، پاک‌سازی و سانسور شوند. توسعه‌دهنده ادعا می‌کند که این مدل‌های محلی به‌گونه‌ای بهینه شده‌اند که کمتر از ۱٪ سی‌پی‌یو و زیر ۴۰۰ مگابایت رم مصرف کنند. همچنین کاربر می‌تواند به‌طور صریح اپلیکیشن‌ها، پنجره‌ها یا URLهای خاصی را فیلتر کند. ابزار مذکور به حالت ناشناس (Incognito) مرورگرها احترام می‌گذارد و از قابلیت زمان‌بندی ضبط نیز پشتیبانی می‌کند.

کاربردهای عملی

برای کاربرانی که به دنبال بهره‌وری هستند، این یعنی می‌توان از چت داخلی، Claude، ChatGPT، Hermes، Openclaw یا هر عامل دیگری خواست تا کارهای پیچیده را انجام دهند:

  • گردآوری زمینه: «تمام اطلاعات مربوط به تسک X را جمع کن»؛ این کار تعداد پرامپت‌های مورد نیاز برای رسیدن به هدف را به‌شدت کم می‌کند.
  • بازیابی اطلاعات: «کارهایی که از ساعت ۸ صبح تا ۴ بعدازظهر روی آن‌ها کار می‌کردم را بازیابی کن و لیستی از موارد انجام‌شده و باقی‌مانده تهیه کن».
  • مدیاری مغز دوم: هوش مصنوعی می‌تواند هر ساعت فعالیت‌ها را در قالب پروژه‌ها، افراد، تسک‌ها و جلسات سازماندهی کرده و به‌صورت فایل‌های Markdown در یک خزانه (Vault) Obsidian ذخیره کند.
  • اتوماسیون CRM: به‌روزرسانی خودکار CRM هرگاه پروفایل لینکدین شخص خاصی بازدید شود.
  • هوش تجاری: بررسی فعالیت‌های هفتگی یک تیم برای شناسایی فهرستی از فرصت‌های اتوماسیون.

این تغییر، هوش مصنوعی را از ابزاری که «استفاده می‌کنیم» به همکاری که «مشاهده می‌کند» تبدیل می‌کند. با ثبت شکاف‌های بین اپلیکیشن‌ها، Screenpipe به عامل‌ها اجازه می‌دهد جریان کاری واقعی یک انسان را درک کنند، نه فقط خروجی نهایی که در یک فایل ذخیره شده است. در واقع سیستم‌عامل خودش تبدیل به یک منبع تولید بازیابی‌افزا (RAG) می‌شود.

Screenpipe در گیت‌هاب به‌صورت Source-available در دسترس است، اما اخیراً به لایسنس تجاری منتقل شد. دلیل این امر این بود که توسعه‌دهنده نتوانست روشی پایدار برای ادامه توسعه پیدا کند در حالی که شرکت‌ها به‌صورت رایگان از ابزار برای مقاصد تجاری استفاده می‌کردند. با این حال، استفاده‌های شخصی، غیرتجاری، غیرانتزاعی، آموزشی و پژوهشی همچنان رایگان است و تنها استفاده‌های تجاری نیاز به لایسنس دارند. نسخه‌هایی که پیش از این تغییر منتشر شده بودند، همچنان تحت لایسنس MIT در دسترس هستند.

اگر می‌خواهید این قابلیت‌ها را تست کنید، می‌توانید ابزار را از طریق اپلیکیشن دسکتاپ یا از طریق CLI با دستور npx screenpipe record اجرا کنید، بدون اینکه نیاز باشد بلافاصله حسابی ایجاد نمایید.

گام بعدی شما

  • اگر به دنبال اتوماسیون واقعی هستید، ابزار را از طریق CLI با دستور npx screenpipe record تست کنید.
  • برای شروع، یک گردش کار ساده برای تبدیل فعالیت‌های روزانه به یادداشت‌های Obsidian تعریف کنید.
  • تنظیمات فیلتر URLها را بررسی کنید تا داده‌های بانکی یا حساس شما هرگز ضبط نشوند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با انتقال حافظه از فضای ابری به محلی، اعتماد (Trust) کاربر را برای نظارت ۲۴ ساعته جلب می‌کند. در نتیجه، عامل‌های هوش مصنوعی از دستیارهای متنی به همکارانی تبدیل می‌شوند که بستر عملیاتی کاربر را کاملاً درک می‌کنند.

تأثیر برای ایران

به‌دلیل ماهیت محلی (Local-first) و استفاده از مدل‌های باز مثل Whisper، این ابزار برای برنامه‌نویسان ایرانی که با محدودیت‌های API مواجه‌اند، راهکاری ایده‌آل برای ساخت عامل‌های شخصی است.

·نگاه ما
تحریریه دات‌هوش

Screenpipe با تبدیل سیستم‌عامل به یک پایگاه داده، در واقع «شکاف بین اپلیکیشن‌ها» را می‌پرد. این رویکرد فرضیه قدیمی که عامل‌ها باید فقط از طریق APIها با نرم‌افزارها bicara کنند را می‌شکند و ثابت می‌کند که مشاهده بصری و رویدادی، سریع‌ترین راه برای درک جریان کار (Workflow) واقعی انسان است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.