A.I

Apple Releases Depth Pro, an Open Source Monocular Depth Estimation AI Model

Biplab Das November 26, 2024

0 13 2 minutes read

Apple ने इस साल कई ओपन-सोर्स आर्टिफिशियल इंटेलिजेंस (AI) मॉडल जारी किए हैं। ये अधिकतर छोटे भाषा मॉडल हैं जो किसी विशिष्ट कार्य के लिए डिज़ाइन किए गए हैं। सूची में जोड़ते हुए, क्यूपर्टिनो-आधारित तकनीकी दिग्गज ने अब डेप्थ प्रो नाम से एक नया एआई मॉडल जारी किया है। यह एक विज़न मॉडल है जो किसी भी छवि के मोनोकुलर गहराई मानचित्र उत्पन्न कर सकता है। यह तकनीक 3डी बनावट, संवर्धित वास्तविकता (एआर) और बहुत कुछ उत्पन्न करने में उपयोगी है। परियोजना के पीछे के शोधकर्ताओं का दावा है कि एआई द्वारा तैयार किए गए गहराई के नक्शे कई कैमरों की मदद से बनाए गए गहराई के नक्शे से बेहतर हैं।

एप्पल ने डेप्थ प्रो एआई मॉडल जारी किया

गहराई का आकलन 3डी मॉडलिंग के साथ-साथ एआर, स्वायत्त ड्राइविंग सिस्टम, रोबोटिक्स और कई अन्य तकनीकों में एक महत्वपूर्ण प्रक्रिया है। मानव आँख एक जटिल लेंस प्रणाली है जो वस्तुओं को एक-बिंदु परिप्रेक्ष्य से देखते हुए भी उनकी गहराई को सटीक रूप से माप सकती है। हालाँकि, कैमरे इसमें उतने अच्छे नहीं हैं। एकल कैमरे से ली गई छवियां इसे द्वि-आयामी बनाती हैं, जिससे समीकरण से गहराई हट जाती है।

इसलिए, ऐसी प्रौद्योगिकियों के लिए जहां किसी वस्तु की गहराई महत्वपूर्ण भूमिका निभाती है, कई कैमरों का उपयोग किया जाता है। हालाँकि, इस तरह की वस्तुओं का मॉडलिंग करना समय लेने वाला और संसाधन-गहन हो सकता है। इसके बजाय, “गहराई प्रो: एक सेकंड से भी कम समय में तीव्र मोनोकुलर मीट्रिक गहराई” शीर्षक वाले एक शोध पत्र में, ऐप्पल ने इस बात पर प्रकाश डाला कि कैसे उसने वस्तुओं की मोनोकुलर छवियों के शून्य-शॉट गहराई मानचित्र उत्पन्न करने के लिए दृष्टि-आधारित एआई मॉडल का उपयोग किया।

डेप्थ प्रो एआई मॉडल गहराई के नक्शे कैसे तैयार करता है
फोटो साभार: एप्पल

एआई मॉडल विकसित करने के लिए, शोधकर्ताओं ने विज़न ट्रांसफार्मर-आधारित (वीआईटी) आर्किटेक्चर का उपयोग किया। 384 x 384 का आउटपुट रिज़ॉल्यूशन चुना गया था, लेकिन इनपुट और प्रोसेसिंग रिज़ॉल्यूशन 1536 x 1536 पर रखा गया था, जिससे एआई मॉडल को विवरण समझने के लिए अधिक जगह मिल गई।

पेपर के प्री-प्रिंट संस्करण में, जो वर्तमान में ऑनलाइन जर्नल arXiv में प्रकाशित हुआ है, शोधकर्ताओं ने दावा किया कि एआई मॉडल अब एक पिंजरे, एक प्यारे बिल्ली के शरीर और मूंछों जैसी दृष्टि से जटिल वस्तुओं के गहराई से मानचित्र सटीक रूप से उत्पन्न कर सकता है, और अधिक। पीढ़ी का समय एक सेकंड कहा जाता है। ओपन-सोर्स AI मॉडल का वेट वर्तमान में GitHub लिस्टिंग पर होस्ट किया जा रहा है। इच्छुक व्यक्ति एकल जीपीयू के आधार पर मॉडल चला सकते हैं।

Source link

Post Views: 33

Biplab Das November 26, 2024

0 13 2 minutes read