تصور کنید هزاران ساعت ویدیو در هارددیسکهای خارجی و پوشههای مختلف شما انبار شده است و حالا میخواهید دقیقاً لحظهای را پیدا کنید که یک اتفاق خاص رخ داده است. اگر هنوز برای پیدا کردن یک کلیپ خاص، ساعتها ویدیو را بهصورت دستی جلو و عقب میبرید، Clipto قصد دارد این تجربه را به چند ثانیه کاهش دهد. این تغییر رویکرد، ارزش پیشنهادی هوش مصنوعی را از «تولید محتوا» به «بازیابی محتوا» تغییر میدهد.
Clipto استارتاپی است که با هدف مقابله با «انباشت محتوا» (Content Glut) متولد شده تا ترابایتها دادههای محلی را قابل جستوجو کند. ارزش فعلی این شرکت ۲۵۰ میلیون دلار برآورد شده است. برخلاف اکثر ابزارهای هوش مصنوعی زاینده (Generative AI) — که مثل هنرمندی هستند که مدام آثار جدید خلق میکنند — تمرکز این ابزار بر بازیابی (Retrieval) است؛ یعنی پیدا کردن دقیق فایلهای موجود روی حافظه شما با استفاده از توصیفات متنی ساده و زبان طبیعی.
به نقل از مستندات شرکت، این استارتاپ که در سال ۲۰۲۳ توسط هنری کانگ (Henry Kang) تأسیس شد، بهتازگی ۱۵ میلیون دلار سرمایه در یک دور جذب سرمایه تمامسهامی (All-equity round) جذب کرده است. در این دور سرمایهگذاری، مجموعهای از سرمایهگذاران برجسته از جمله HSG (سکویا چین سابق)، GL Ventures، EnvisionX Capital، Palm Drive Capital، Hans Tung، Lu Zhang و 522 Ventures مشارکت داشتهاند.
رویکرد کانگ ریشه در تجربه ۲۰ ساله او دارد. او در سال ۲۰۰۶ و در دوران دکترا در دانشگاه کارنگی ملون، رباتهایی ساخت که میتوانستند محیط اطراف را ضبط کرده، اشیا را شناسایی کنند و مکان آنها را به خاطر بسپارند. او بعدها این منطق را در استارتاپی به کار برد که لباسهای داخل کمد را ردیابی میکرد تا لباسهای مناسب را پیشنهاد دهد. همچنین شرکت دومی به نام ZenVideo تأسیس کرد که بر خلق ویدیو تمرکز داشت و در سال ۲۰۲۰ توسط شرکت تنسنت (Tencent) خریداری شد.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت دادههای محلی اشاره کردیم، انتقال پردازش از ابر به لبه، کلید اعتماد کاربران در عصر هوش مصنوعی است. کانگ معتقد است چالش عصر فعلی نه کمبود محتوا، بلکه افراط در تولید آن است. او اشاره میکند که حجم عظیمی از ویدیوها در کامپیوترها بلااستفاده میمانند و همین موضوع او را ترغیب کرد تا Clipto را به همراه چندین عضو از تیم مؤسس قبلی خود بسازد.
این ابزار ویدیوها، فایلهای صوتی، تصاویر و اسناد را مستقیماً روی دستگاه کاربر فهرستبندی میکند. جزئیات فنی این سامانه عبارت است از:
- پردازش محلی: تمام عملیات فهرستبندی و جستوجو روی سختافزار کاربر انجام میشود و نیازی به آپلود دادهها در فضای ابری نیست.
- ادغام با MCP: دو هفته پیش، Clipto پشتیبانی از پروتکل زمینهٔ مدل (Model Context Protocol یا MCP) — که شبیه به یک مترجم استاندارد است و اجازه میدهد اپلیکیشنهای مختلف با منابع دادهای متفاوت حرف بزنند — را اضافه کرد. این استاندارد به عاملهای هوش مصنوعی مانند ChatGPT و Claude اجازه میدهد تا به فایلهای فهرستشده روی سیستم محلی کاربر دسترسی داشته باشند. این رویکرد در راستای بهینهسازی دسترسی عاملهای هوش مصنوعی به دادههاست، مشابه آنچه استارتاپ Keenable برای کاهش هزینههای API و بهبود ایندکس وب دنبال میکند.
- امنیت: دسترسی به دادهها تنها با درخواست فعال و مجوز کاربر صورت میگیرد. اپلیکیشنهای هوش مصنوعی تنها میتوانند اطلاعاتی را بازیابی کنند که در محدوده (Scope) تعیینشده توسط کاربر قرار داشته باشد.
- پایگاه کاربران: طبق اعلام شرکت، از زمان عرضه بیش از ۳۰ میلیون کاربر جذب شدهاند که صدها هزار نفر آنها مشترک پرداختکننده هستند. کانگ خاطرنشان کرد که بخش قابل توجهی از این مشتریان بیش از دو سال است که اشتراک خود را تمدید کردهاند.
از نظر تجاری، به گزارش هنری کانگ، درآمد سالانه تکرارشونده (ARR) این شرکت در ابتدای سال ۲۰۲۶ به ۱۵ میلیون دلار رسیده است. Clipto با تیمی کوچک (کمی بیش از ۲۰ نفر) که بین سانفرانسیسکو، هنگکنگ و سنگاپور تقسیم شدهاند، در وضعیت سوددهی خالص (Net-income basis) قرار دارد.
جالب است بدانید که اگرچه این ابزار در ابتدا برای تولیدکنندگان ویدیو ساخته شد، اما اکنون آنها تنها ۲۵ تا ۳۳ درصد از کل کاربران را تشکیل میدهند. بقیه کاربران متخصصانی چون وکلا، پزشکان، پژوهشگران، بازاریابان، متخصصان منابع انسانی و اساتیدی هستند که آرشیوهای عظیمی از ضبطهای صوتی و تصویری را مدیریت میکنند.
در بازار رقابتی، غولهایی مثل Adobe در نرمافزار Premiere قابلیت جستوجوی هوش مصنوعی را ارائه میدهند و شرکتهای Apple و Google در سرویسهای Photos خود جستوجوی زبان طبیعی برای رسانهها فراهم کردهاند. در واقع، گوگل پیشتر با استفاده از رونوشتهای یوتیوب برای تغذیه AI Overviews نشان داد که تبدیل محتوای ویدئویی به متن، کلید بازیابی سریع اطلاعات است.
شرطبندی Clipto بر این است که یک ابزار مستقل و چندپلتفرمی که دادههای محلی را به عاملهای هوش مصنوعی خارجی متصل میکند، ارزش بیشتری نسبت به یک ویژگی محدود در یک اکوسیستم بسته دارد. Clipto با ایفای نقش به عنوان پلی میان هارددیسک کاربر و مدلهای زبانی بزرگ (LLM)، یک پایگاه دانش شخصیسازی شده از رسانههای خام میسازد. این مدل از جستوجوی معنایی، یادآور پیشرفتهای شرکت Exa Labs در زمینه جستوجوی عاملمحور (Agentic Search) است که بر اساس درک عمیقتر از دادهها عمل میکند.
این رویکرد، حافظه کامپیوتر را از یک «گورستان دیجیتال» به یک دارایی فعال تبدیل میکند. برای یک کاربر حرفهای، این یعنی زمانی که صرف جستوجوی یک نقلقول خاص در یک جلسه ضبطشده یا یک کلیپ در یک فیلمبرداری خام میشود، از چندین ساعت به چند ثانیه کاهش مییابد.
سرمایه جدید برای بهبود مدلهای هوش مصنوعی و بهینهسازی زیرساختهای محاسباتی هزینه میشود تا نرمافزار روی سختافزارهای معمولی مصرفکننده نیز با سرعت بالا اجرا شود. همچنین کانگ قصد دارد ادغام با عاملهای هوش مصنوعی بیشتری را گسترش دهد تا کاربرد این ابزار را افزایش دهد.
گام بعدی شما
- اگر آرشیو بزرگی از جلسات ضبطشده یا ویدیوهای خام دارید، بررسی کنید که آیا سختافزار شما برای پردازش محلی (Local Indexing) آماده است یا خیر.
- پروتکل MCP را دنبال کنید تا متوجه شوید چگونه میتوانید عاملهای هوش مصنوعی خود را به منابع دادهای شخصی متصل کنید.
- برای کاهش هزینههای ابری، مدلهای بازیابی محلی را جایگزین آپلودهای حجیم کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell و پردازش لبه مراجعه کنید.




گفتگو