تشخیص اشیا در ویدئو چگونه انجام میشود؟
تشخیص اشیا در ویدئو چگونه انجام میشود؟ آشنایی با فناوری Video Object Detection
امروزه بسیاری از سیستمهای هوشمند فقط به تشخیص اشیا در یک تصویر ثابت بسنده نمیکنند. آنها باید اشیای متحرک را در ویدئو شناسایی کنند، مسیر حرکتشان را دنبال کنند و از تغییر رفتار، رویدادهای مهم را تشخیص دهند. این قابلیت را تشخیص اشیا در ویدئو (Video Object Detection) مینامند. این فناوری یکی از شاخههای مهم بینایی کامپیوتر و یادگیری عمیق است. در سالهای اخیر، با رشد دوربینهای هوشمند، خودروهای خودران و سامانههای نظارتی، اهمیت آن بیشتر شده است.
برای مثال، یک خودروی خودران باید در هر لحظه بداند خودروهای اطراف کجا هستند، عابران چگونه حرکت میکنند، دوچرخهها از کدام مسیر عبور میکنند و آیا مانعی در مسیر وجود دارد یا نه. از طرف دیگر، یک دوربین نظارتی هوشمند نباید فقط تصویر را ثبت کند. این دوربین باید ورود افراد، توقف غیرعادی خودروها، رها شدن اشیا و تجمعهای مشکوک را در طول زمان تحلیل کند. همین نیاز، تشخیص اشیا در ویدئو را به فناوری کلیدی در حملونقل هوشمند، امنیت، رباتیک، صنعت، ورزش و شهرهای هوشمند تبدیل کرده است.

تشخیص اشیا در ویدئو چه تفاوتی با تشخیص در تصویر دارد؟
در نگاه اول، تشخیص اشیا در تصویر و ویدئو شبیه هم به نظر میرسند. در هر دو حالت، هدف شناسایی اشیای موجود در صحنه است. اما ویدئو پیچیدگی بیشتری دارد، چون از مجموعهای از فریمهای متوالی تشکیل میشود. سیستم باید علاوه بر تشخیص هر شیء، رابطه آن را با فریمهای قبلی و بعدی هم درک کند.
در تشخیص تصویر، مدل فقط یک فریم را بررسی میکند. پس از شناسایی اشیا، کار تمام میشود. اما در ویدئو، مدل باید بفهمد شیء دیدهشده در فریم بعدی همان شیء قبلی است یا یک شیء جدید. این کار وقتی دشوارتر میشود که اشیا سریع حرکت کنند، بخشی از آنها پشت اشیای دیگر پنهان شود یا نور و زاویه دید تغییر کند.
به همین دلیل، سیستمهای تشخیص اشیا در ویدئو معمولاً فقط به یک مدل تشخیص تصویر تکیه نمیکنند. آنها از ترکیب چند مرحله استفاده میکنند:
- دریافت ویدئو و استخراج فریمها
- تشخیص اشیا در هر فریم
- رهگیری اشیا در فریمهای متوالی
- تحلیل رفتار و تصمیمگیری بر اساس الگوهای حرکتی
این تفاوت باعث میشود تشخیص اشیا در ویدئو از نظر محاسباتی سنگینتر باشد. همچنین این کار به الگوریتمهای دقیقتری برای حفظ هویت هر شیء در طول زمان نیاز دارد.
فرایند تشخیص اشیا در ویدئو چگونه انجام میشود؟
در عمل، ویدئو چیزی جز مجموعهای از تصاویر پشتسرهم نیست. برای نمونه، یک ویدئوی ۳۰ فریم بر ثانیه در هر ثانیه شامل ۳۰ تصویر مجزا است. سیستم تشخیص اشیا ابتدا این فریمها را دریافت میکند. سپس هر فریم را مانند یک تصویر مستقل تحلیل میکند.
در بسیاری از سامانههای بلادرنگ، این کار همزمان با دریافت تصویر از دوربین انجام میشود. در این حالت، سیستم نیازی به ذخیره کامل ویدئو ندارد. سرعت پردازش در اینجا اهمیت زیادی دارد.
پس از دریافت هر فریم، مدل بینایی کامپیوتر اشیای موجود را شناسایی میکند. خروجی معمولاً شامل نوع شیء، محل قرارگیری، میزان اطمینان مدل و کادر تشخیص یا Bounding Box است. برای مثال، مدل ممکن است تشخیص دهد که یک خودرو با اطمینان ۹۸ درصد و یک عابر پیاده با اطمینان ۹۵ درصد در تصویر حضور دارند.
اما این فقط آغاز کار است. در فریم بعدی باید مشخص شود که این خودرو یا عابر همان شیء قبلی است یا نه. اینجا رهگیری اشیا وارد عمل میشود. الگوریتم رهگیری با بررسی موقعیت، سرعت، جهت حرکت و ویژگیهای ظاهری، برای هر شیء یک شناسه اختصاصی ایجاد میکند. سپس مسیر آن را در طول ویدئو دنبال میکند.
در بسیاری از کاربردهای پیشرفته، مرحله نهایی فقط تشخیص و رهگیری نیست. تحلیل رفتار هم اهمیت دارد. برای مثال، سیستم میتواند موارد زیر را تشخیص دهد:
- ورود فرد به منطقه ممنوعه
- توقف غیرعادی یک خودرو
- رها شدن یک شیء مشکوک
- دویدن یا سقوط یک فرد
- تجمع غیرعادی افراد
این فرایند، سیستم را از یک ابزار تصویربرداری ساده به یک سامانه هوشمند تحلیل رویداد تبدیل میکند.
چه مدلها و الگوریتمهایی در این فناوری استفاده میشوند؟
شبکههای عصبی در تشخیص اشیا
پیشرفت تشخیص اشیا در ویدئو تا حد زیادی به توسعه شبکههای عصبی عمیق وابسته است. در میان این مدلها، شبکههای عصبی کانولوشنی (CNN) سالهاست که پایه اصلی بسیاری از سامانههای بینایی کامپیوتر هستند. این شبکهها ویژگیهای سادهای مانند لبهها، خطوط و بافتها را استخراج میکنند. سپس آنها را به مفاهیم پیچیدهتری مانند خودرو، انسان یا حیوان تبدیل میکنند.
به همین دلیل، هنوز هم بسیاری از مدلهای تشخیص اشیا از معماری CNN استفاده میکنند. این موضوع بهویژه در پروژههایی مهم است که دقت و پایداری در آنها اولویت دارد.
در سالهای اخیر، پژوهشگران مدلهای مبتنی بر Transformer را هم وارد حوزه بینایی کامپیوتر کردهاند. این مدلها ارتباط بین بخشهای مختلف تصویر را خوب درک میکنند. به همین دلیل، در صحنههای شلوغ یا پیچیده عملکرد قابلتوجهی دارند. انتظار میرود با پیشرفت سختافزار و بهینهتر شدن الگوریتمها، استفاده از این مدلها در پروژههای صنعتی بیشتر شود.
الگوریتمهای رایج تشخیص و رهگیری
از میان الگوریتمهای پرکاربرد تشخیص اشیا، چند مدل بیش از بقیه شناخته شدهاند:
- YOLO (You Only Look Once): یکی از سریعترین و محبوبترین مدلها برای پردازش بلادرنگ است. این مدل در خودروهای خودران و دوربینهای نظارتی کاربرد گستردهای دارد.
- Faster R-CNN: دقت بالایی دارد، اما از YOLO کندتر است. این مدل برای پروژههایی مناسب است که کیفیت تشخیص در آنها مهمتر از سرعت باشد.
- SSD (Single Shot Detector): این مدل تلاش میکند تعادل خوبی میان سرعت و دقت ایجاد کند. بسیاری از سیستمهای صنعتی از آن بهره میبرند.
- Vision Transformer: این نسل جدید از مدلهای بینایی، روابط میان اشیا را خوب تحلیل میکند و در صحنههای پیچیده عملکرد بسیار خوبی دارد.
پس از تشخیص، مرحله رهگیری هم با الگوریتمهایی مانند SORT، Deep SORT و ByteTrack انجام میشود. SORT سبک و سریع است. Deep SORT علاوه بر موقعیت، ویژگیهای ظاهری را هم بررسی میکند. ByteTrack هم در مدیریت اشیای با احتمال تشخیص پایین عملکرد خوبی دارد.
انتخاب میان این الگوریتمها به سرعت موردنیاز، تعداد اشیا و نوع کاربرد بستگی دارد.
این فناوری در چه حوزههایی استفاده میشود؟
تشخیص اشیا در ویدئو امروز در بسیاری از صنایع کاربرد دارد و هر سال هم کاربردهای تازهتری پیدا میکند.
یکی از مهمترین حوزهها خودروهای خودران است. این خودروها باید بهطور مداوم محیط اطراف را تحلیل کنند. آنها با این فناوری خودروهای دیگر، عابران پیاده، دوچرخهها، تابلوهای راهنمایی و موانع جاده را شناسایی میکنند. سپس بر اساس آن تصمیم میگیرند. بدون تشخیص دقیق و سریع اشیا، حرکت ایمن در محیطهای واقعی تقریباً غیرممکن است.
در سیستمهای امنیتی و نظارتی هم این فناوری نقش مهمی دارد. دوربینهای هوشمند میتوانند ورود غیرمجاز، رفتارهای مشکوک، رها شدن اشیا یا تجمع افراد را تشخیص دهند. سپس در صورت نیاز هشدار میفرستند.
در رباتیک، رباتهای صنعتی و خدماتی برای تعامل با محیط باید اشیا را شناسایی کنند و موقعیت آنها را بدانند. در غیر این صورت، انجام کارهایی مانند جابهجایی اجسام یا حرکت در محیطهای ناشناخته دشوار میشود.
علاوه بر این، در ورزش و تحلیل عملکرد از این فناوری برای بررسی حرکت بازیکنان، اندازهگیری سرعت، تحلیل تاکتیکها و تولید آمار دقیق استفاده میکنند. در فروشگاههای هوشمند هم تشخیص اشیا برای شمارش مشتریان، تحلیل مسیر حرکت افراد، بررسی رفتار خرید و مدیریت موجودی کالا کاربرد دارد. این اطلاعات به بهبود تجربه مشتری و افزایش بهرهوری فروشگاه کمک میکند.
چه چالشهایی وجود دارد و آینده این فناوری به کدام سمت میرود؟
با وجود پیشرفتهای چشمگیر، تشخیص اشیا در ویدئو هنوز با چالشهای مهمی روبهرو است. تغییر شرایط نوری، کاهش کیفیت تصویر، پنهان شدن اشیا پشت یکدیگر، حرکت بسیار سریع، ازدحام زیاد در صحنه و نیاز به پردازش حجم بالای داده در زمان کوتاه، همگی میتوانند دقت سیستم را کاهش دهند.
در کاربردهای بلادرنگ، مصرف منابع پردازشی هم اهمیت زیادی دارد. سیستم باید هم سریع باشد و هم پایدار عمل کند. به همین دلیل، پژوهشگران همچنان روی مدلهای سبکتر، دقیقتر و بهینهتر کار میکنند.
آینده این فناوری بسیار امیدوارکننده به نظر میرسد. با پیشرفت هوش مصنوعی، مدلها میتوانند با داده آموزشی کمتر آموزش ببینند، رفتار انسانها را بهتر تحلیل کنند و در شرایط پیچیده عملکرد قابلاعتمادتری داشته باشند.
همچنین ترکیب بینایی کامپیوتر با هوش مصنوعی مولد، مدلهای چندوجهی (Multimodal AI) و پردازش لبه (Edge AI) امکانات جدیدی ایجاد میکند. در نتیجه، بسیاری از پردازشها بهجای سرورهای ابری، مستقیماً روی دوربینها یا دستگاههای هوشمند انجام میشوند. این تغییر هم سرعت را افزایش میدهد و هم وابستگی به شبکه را کاهش میدهد.
جمعبندی
تشخیص اشیا در ویدئو یکی از مهمترین فناوریهای بینایی کامپیوتر است. این فناوری امکان شناسایی، رهگیری و تحلیل رفتار اشیا را در فریمهای متوالی فراهم میکند. این حوزه با مدلهایی مانند YOLO، Faster R-CNN، SSD و Vision Transformer و همچنین الگوریتمهای رهگیری مانند SORT، Deep SORT و ByteTrack کار میکند.
امروزه از این فناوری در خودروهای خودران، سیستمهای امنیتی، رباتیک، تحلیل مسابقات ورزشی، فروشگاههای هوشمند و بسیاری از صنایع دیگر بهره میبرند. با ادامه پیشرفت مدلهای هوش مصنوعی و سختافزارهای پردازشی، تشخیص اشیا در ویدئو به یکی از ارکان اصلی سیستمهای هوشمند آینده تبدیل خواهد شد.