هوش مصنوعی

تشخیص اشیا در ویدئو چگونه انجام می‌شود؟

تشخیص اشیا در ویدیو

تشخیص اشیا در ویدئو چگونه انجام می‌شود؟ آشنایی با فناوری Video Object Detection

امروزه بسیاری از سیستم‌های هوشمند فقط به تشخیص اشیا در یک تصویر ثابت بسنده نمی‌کنند. آن‌ها باید اشیای متحرک را در ویدئو شناسایی کنند، مسیر حرکتشان را دنبال کنند و از تغییر رفتار، رویدادهای مهم را تشخیص دهند. این قابلیت را تشخیص اشیا در ویدئو (Video Object Detection) می‌نامند. این فناوری یکی از شاخه‌های مهم بینایی کامپیوتر و یادگیری عمیق است. در سال‌های اخیر، با رشد دوربین‌های هوشمند، خودروهای خودران و سامانه‌های نظارتی، اهمیت آن بیشتر شده است.

برای مثال، یک خودروی خودران باید در هر لحظه بداند خودروهای اطراف کجا هستند، عابران چگونه حرکت می‌کنند، دوچرخه‌ها از کدام مسیر عبور می‌کنند و آیا مانعی در مسیر وجود دارد یا نه. از طرف دیگر، یک دوربین نظارتی هوشمند نباید فقط تصویر را ثبت کند. این دوربین باید ورود افراد، توقف غیرعادی خودروها، رها شدن اشیا و تجمع‌های مشکوک را در طول زمان تحلیل کند. همین نیاز، تشخیص اشیا در ویدئو را به فناوری کلیدی در حمل‌ونقل هوشمند، امنیت، رباتیک، صنعت، ورزش و شهرهای هوشمند تبدیل کرده است.

تشخیص اشیا (Object Detection) چگونه کار می‌کند

تشخیص اشیا در ویدئو چه تفاوتی با تشخیص در تصویر دارد؟

در نگاه اول، تشخیص اشیا در تصویر و ویدئو شبیه هم به نظر می‌رسند. در هر دو حالت، هدف شناسایی اشیای موجود در صحنه است. اما ویدئو پیچیدگی بیشتری دارد، چون از مجموعه‌ای از فریم‌های متوالی تشکیل می‌شود. سیستم باید علاوه بر تشخیص هر شیء، رابطه آن را با فریم‌های قبلی و بعدی هم درک کند.

در تشخیص تصویر، مدل فقط یک فریم را بررسی می‌کند. پس از شناسایی اشیا، کار تمام می‌شود. اما در ویدئو، مدل باید بفهمد شیء دیده‌شده در فریم بعدی همان شیء قبلی است یا یک شیء جدید. این کار وقتی دشوارتر می‌شود که اشیا سریع حرکت کنند، بخشی از آن‌ها پشت اشیای دیگر پنهان شود یا نور و زاویه دید تغییر کند.

به همین دلیل، سیستم‌های تشخیص اشیا در ویدئو معمولاً فقط به یک مدل تشخیص تصویر تکیه نمی‌کنند. آن‌ها از ترکیب چند مرحله استفاده می‌کنند:

  1. دریافت ویدئو و استخراج فریم‌ها
  2. تشخیص اشیا در هر فریم
  3. رهگیری اشیا در فریم‌های متوالی
  4. تحلیل رفتار و تصمیم‌گیری بر اساس الگوهای حرکتی

این تفاوت باعث می‌شود تشخیص اشیا در ویدئو از نظر محاسباتی سنگین‌تر باشد. همچنین این کار به الگوریتم‌های دقیق‌تری برای حفظ هویت هر شیء در طول زمان نیاز دارد.

فرایند تشخیص اشیا در ویدئو چگونه انجام می‌شود؟

در عمل، ویدئو چیزی جز مجموعه‌ای از تصاویر پشت‌سرهم نیست. برای نمونه، یک ویدئوی ۳۰ فریم بر ثانیه در هر ثانیه شامل ۳۰ تصویر مجزا است. سیستم تشخیص اشیا ابتدا این فریم‌ها را دریافت می‌کند. سپس هر فریم را مانند یک تصویر مستقل تحلیل می‌کند.

در بسیاری از سامانه‌های بلادرنگ، این کار هم‌زمان با دریافت تصویر از دوربین انجام می‌شود. در این حالت، سیستم نیازی به ذخیره کامل ویدئو ندارد. سرعت پردازش در اینجا اهمیت زیادی دارد.

پس از دریافت هر فریم، مدل بینایی کامپیوتر اشیای موجود را شناسایی می‌کند. خروجی معمولاً شامل نوع شیء، محل قرارگیری، میزان اطمینان مدل و کادر تشخیص یا Bounding Box است. برای مثال، مدل ممکن است تشخیص دهد که یک خودرو با اطمینان ۹۸ درصد و یک عابر پیاده با اطمینان ۹۵ درصد در تصویر حضور دارند.

اما این فقط آغاز کار است. در فریم بعدی باید مشخص شود که این خودرو یا عابر همان شیء قبلی است یا نه. اینجا رهگیری اشیا وارد عمل می‌شود. الگوریتم رهگیری با بررسی موقعیت، سرعت، جهت حرکت و ویژگی‌های ظاهری، برای هر شیء یک شناسه اختصاصی ایجاد می‌کند. سپس مسیر آن را در طول ویدئو دنبال می‌کند.

در بسیاری از کاربردهای پیشرفته، مرحله نهایی فقط تشخیص و رهگیری نیست. تحلیل رفتار هم اهمیت دارد. برای مثال، سیستم می‌تواند موارد زیر را تشخیص دهد:

  • ورود فرد به منطقه ممنوعه
  • توقف غیرعادی یک خودرو
  • رها شدن یک شیء مشکوک
  • دویدن یا سقوط یک فرد
  • تجمع غیرعادی افراد

این فرایند، سیستم را از یک ابزار تصویربرداری ساده به یک سامانه هوشمند تحلیل رویداد تبدیل می‌کند.

چه مدل‌ها و الگوریتم‌هایی در این فناوری استفاده می‌شوند؟

شبکه‌های عصبی در تشخیص اشیا

پیشرفت تشخیص اشیا در ویدئو تا حد زیادی به توسعه شبکه‌های عصبی عمیق وابسته است. در میان این مدل‌ها، شبکه‌های عصبی کانولوشنی (CNN) سال‌هاست که پایه اصلی بسیاری از سامانه‌های بینایی کامپیوتر هستند. این شبکه‌ها ویژگی‌های ساده‌ای مانند لبه‌ها، خطوط و بافت‌ها را استخراج می‌کنند. سپس آن‌ها را به مفاهیم پیچیده‌تری مانند خودرو، انسان یا حیوان تبدیل می‌کنند.

به همین دلیل، هنوز هم بسیاری از مدل‌های تشخیص اشیا از معماری CNN استفاده می‌کنند. این موضوع به‌ویژه در پروژه‌هایی مهم است که دقت و پایداری در آن‌ها اولویت دارد.

در سال‌های اخیر، پژوهشگران مدل‌های مبتنی بر Transformer را هم وارد حوزه بینایی کامپیوتر کرده‌اند. این مدل‌ها ارتباط بین بخش‌های مختلف تصویر را خوب درک می‌کنند. به همین دلیل، در صحنه‌های شلوغ یا پیچیده عملکرد قابل‌توجهی دارند. انتظار می‌رود با پیشرفت سخت‌افزار و بهینه‌تر شدن الگوریتم‌ها، استفاده از این مدل‌ها در پروژه‌های صنعتی بیشتر شود.

الگوریتم‌های رایج تشخیص و رهگیری

از میان الگوریتم‌های پرکاربرد تشخیص اشیا، چند مدل بیش از بقیه شناخته شده‌اند:

  • YOLO (You Only Look Once): یکی از سریع‌ترین و محبوب‌ترین مدل‌ها برای پردازش بلادرنگ است. این مدل در خودروهای خودران و دوربین‌های نظارتی کاربرد گسترده‌ای دارد.
  • Faster R-CNN: دقت بالایی دارد، اما از YOLO کندتر است. این مدل برای پروژه‌هایی مناسب است که کیفیت تشخیص در آن‌ها مهم‌تر از سرعت باشد.
  • SSD (Single Shot Detector): این مدل تلاش می‌کند تعادل خوبی میان سرعت و دقت ایجاد کند. بسیاری از سیستم‌های صنعتی از آن بهره می‌برند.
  • Vision Transformer: این نسل جدید از مدل‌های بینایی، روابط میان اشیا را خوب تحلیل می‌کند و در صحنه‌های پیچیده عملکرد بسیار خوبی دارد.

پس از تشخیص، مرحله رهگیری هم با الگوریتم‌هایی مانند SORT، Deep SORT و ByteTrack انجام می‌شود. SORT سبک و سریع است. Deep SORT علاوه بر موقعیت، ویژگی‌های ظاهری را هم بررسی می‌کند. ByteTrack هم در مدیریت اشیای با احتمال تشخیص پایین عملکرد خوبی دارد.

انتخاب میان این الگوریتم‌ها به سرعت موردنیاز، تعداد اشیا و نوع کاربرد بستگی دارد.

این فناوری در چه حوزه‌هایی استفاده می‌شود؟

تشخیص اشیا در ویدئو امروز در بسیاری از صنایع کاربرد دارد و هر سال هم کاربردهای تازه‌تری پیدا می‌کند.

یکی از مهم‌ترین حوزه‌ها خودروهای خودران است. این خودروها باید به‌طور مداوم محیط اطراف را تحلیل کنند. آن‌ها با این فناوری خودروهای دیگر، عابران پیاده، دوچرخه‌ها، تابلوهای راهنمایی و موانع جاده را شناسایی می‌کنند. سپس بر اساس آن تصمیم می‌گیرند. بدون تشخیص دقیق و سریع اشیا، حرکت ایمن در محیط‌های واقعی تقریباً غیرممکن است.

در سیستم‌های امنیتی و نظارتی هم این فناوری نقش مهمی دارد. دوربین‌های هوشمند می‌توانند ورود غیرمجاز، رفتارهای مشکوک، رها شدن اشیا یا تجمع افراد را تشخیص دهند. سپس در صورت نیاز هشدار می‌فرستند.

در رباتیک، ربات‌های صنعتی و خدماتی برای تعامل با محیط باید اشیا را شناسایی کنند و موقعیت آن‌ها را بدانند. در غیر این صورت، انجام کارهایی مانند جابه‌جایی اجسام یا حرکت در محیط‌های ناشناخته دشوار می‌شود.

علاوه بر این، در ورزش و تحلیل عملکرد از این فناوری برای بررسی حرکت بازیکنان، اندازه‌گیری سرعت، تحلیل تاکتیک‌ها و تولید آمار دقیق استفاده می‌کنند. در فروشگاه‌های هوشمند هم تشخیص اشیا برای شمارش مشتریان، تحلیل مسیر حرکت افراد، بررسی رفتار خرید و مدیریت موجودی کالا کاربرد دارد. این اطلاعات به بهبود تجربه مشتری و افزایش بهره‌وری فروشگاه کمک می‌کند.

چه چالش‌هایی وجود دارد و آینده این فناوری به کدام سمت می‌رود؟

با وجود پیشرفت‌های چشمگیر، تشخیص اشیا در ویدئو هنوز با چالش‌های مهمی روبه‌رو است. تغییر شرایط نوری، کاهش کیفیت تصویر، پنهان شدن اشیا پشت یکدیگر، حرکت بسیار سریع، ازدحام زیاد در صحنه و نیاز به پردازش حجم بالای داده در زمان کوتاه، همگی می‌توانند دقت سیستم را کاهش دهند.

در کاربردهای بلادرنگ، مصرف منابع پردازشی هم اهمیت زیادی دارد. سیستم باید هم سریع باشد و هم پایدار عمل کند. به همین دلیل، پژوهشگران همچنان روی مدل‌های سبک‌تر، دقیق‌تر و بهینه‌تر کار می‌کنند.

آینده این فناوری بسیار امیدوارکننده به نظر می‌رسد. با پیشرفت هوش مصنوعی، مدل‌ها می‌توانند با داده آموزشی کمتر آموزش ببینند، رفتار انسان‌ها را بهتر تحلیل کنند و در شرایط پیچیده عملکرد قابل‌اعتمادتری داشته باشند.

همچنین ترکیب بینایی کامپیوتر با هوش مصنوعی مولد، مدل‌های چندوجهی (Multimodal AI) و پردازش لبه (Edge AI) امکانات جدیدی ایجاد می‌کند. در نتیجه، بسیاری از پردازش‌ها به‌جای سرورهای ابری، مستقیماً روی دوربین‌ها یا دستگاه‌های هوشمند انجام می‌شوند. این تغییر هم سرعت را افزایش می‌دهد و هم وابستگی به شبکه را کاهش می‌دهد.

جمع‌بندی

تشخیص اشیا در ویدئو یکی از مهم‌ترین فناوری‌های بینایی کامپیوتر است. این فناوری امکان شناسایی، رهگیری و تحلیل رفتار اشیا را در فریم‌های متوالی فراهم می‌کند. این حوزه با مدل‌هایی مانند YOLO، Faster R-CNN، SSD و Vision Transformer و همچنین الگوریتم‌های رهگیری مانند SORT، Deep SORT و ByteTrack کار می‌کند.

امروزه از این فناوری در خودروهای خودران، سیستم‌های امنیتی، رباتیک، تحلیل مسابقات ورزشی، فروشگاه‌های هوشمند و بسیاری از صنایع دیگر بهره می‌برند. با ادامه پیشرفت مدل‌های هوش مصنوعی و سخت‌افزارهای پردازشی، تشخیص اشیا در ویدئو به یکی از ارکان اصلی سیستم‌های هوشمند آینده تبدیل خواهد شد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *