الرؤية الحاسوبية
تحويل البكسلات إلى أجسام ومشاهد وبنية ثلاثية الأبعاد
OVERVIEW
- جميع المداخل
- 6
- مبتدئ
- 2
- متوسط
- 3
- متقدم
- 1
To a computer an image is just a grid of numbers; the hard part of vision has never been storing it but understanding it. This domain begins with the locality and weight sharing of convolution and connects classification, detection, segmentation, generation and 3D reconstruction, explaining what bottleneck each landmark architecture actually broke.
الأسئلة التي يجيب عنها هذا المجال
- Q1
What does a convolution kernel actually learn?
- Q2
How do classification, detection and segmentation differ?
- Q3
How does a machine recover 3D from 2D images?
مداخل هذا المجال
- 01التمثيل الرقمي للصورةمبتدئالصورة بالنسبة للآلة ليست سوى شبكات من الأرقام متراكبة
- 02عمليات الالتفافمبتدئقالب صغير يمسح الصورة كاملة ليكشف الحواف والملامح والأشكال
- 03تصنيف الصورمتوسطلا تخبره بأن «للقطط شوارب» — اعرض عليه قططًا كافية وسيستنتجها بنفسه
- 04كشف الأجساممتوسطمن «ما الذي في الصورة» إلى «ماذا وأين وكم العدد»
- 05التجزئة الدلاليةمتوسطتلوين كل بكسل: ليس إطارًا حول الجسم، بل دفتر تلوين
- 06الرؤية ذاتية الإشراف والتعلّم التقابلي متعدد الوسائطمتقدمبلا وسوم: يتعلّم الرؤية باستنتاج أي الصور متطابقة