Intel Labs, nuovi modelli AI per la computer vision con VI-Depth 1.0 e MiDaS 3.1
VI-Depth 1.0 e MiDaS 3.1 sono i due nuovi modelli AI open source messi a punto dagli Intel Labs per migliorare la "depth estimation" nel settore della computer vision. Entrambi sono disponibili su Github.
di Manolo De Agostini pubblicata il 23 Marzo 2023, alle 17:11 nel canale WebIntel
Gli Intel Labs hanno messo a punto due nuovi modelli AI per la computer vision chiamati VI-Depth 1.0 e MiDaS 3.1. I due nuovi modelli, open source con licenza MIT, sono disponibili su GitHub (qui e qui) e puntano a migliorare la "depth estimation", cioè la stima della profondità.
Che si tratti di robotica, realtà aumentata o virtuale, la stima della profondità è un compito di computer vision complesso ma essenziale in un'ampia gamma di applicazioni. Le attuali soluzioni spesso faticano a stimare correttamente le distanze, un elemento cruciale per qualsiasi tecnologia robotica che deve muoversi in uno spazio ed evitare ostacoli basandosi sulla navigazione visiva.
In soccorso della comunità degli sviluppatori arrivano i ricercatori degli Intel Labs con due modelli AI dedicati alla stima di profondità: una dedicato alla "visual-inertial depth estimation" e uno alla "robust relative depth estimation" (RDE).

L'ultimo modello RDE, MiDaS 3.1, usa una sola immagine come input. Grazie alla sua formazione su un set di dati ampio e diversificato, può adattarsi in modo efficiente a una gamma più ampia di attività e ambienti. L'ultima versione di MiDaS migliora la precisione del modello per RDE di circa il 30%.
MiDaS è stato incorporato in molti progetti, in particolare Stable Diffusion 2.0, dove abilita la funzione depth-to-image che deduce la profondità di un'immagine di input e quindi genera nuove immagini usando sia il testo che le informazioni sulla profondità.
Ad esempio, il creator Scottie Fox ha usato una combinazione di Stable Diffusion e MiDaS per creare un ambiente VR a 360 gradi. Questa tecnologia potrebbe portare a nuove applicazioni virtuali, tra cui la ricostruzione della scena del crimine per casi giudiziari, ambienti terapeutici per l'assistenza sanitaria ed esperienze di gioco immersive.
Quanto a RDE, sebbene abbia una buona generalizzabilità, la mancanza di scala ne riduce l'utilità in quelle attività che richiedono profondità metrica, come la mappatura, la pianificazione, la navigazione, il riconoscimento di oggetti, la ricostruzione 3D e l'editing di immagini. I ricercatori degli Intel Labs stanno affrontando questo problema con VI-Depth, un altro modello di intelligenza artificiale che fornisce una stima accurata della profondità.
VI-Depth è una pipeline visiva-inerziale per la stima della profondità che integra la stima della profondità monoculare e l'odometria visivo-inerziale (VIO) per produrre stime della profondità densa con una scala metrica. Questo approccio fornisce una stima accurata della profondità, che può aiutare nella ricostruzione della scena, nella mappatura e nella manipolazione degli oggetti.

L'integrazione di dati inerziali può aiutare a risolvere le ambiguità nella scala. La maggior parte dei dispositivi mobili contiene già unità di misura inerziale (IMU). L'allineamento globale determina la scala globale appropriata, mentre l'allineamento della scala densa (SML) opera localmente e spinge o trascina le regioni verso la profondità metrica corretta.
La rete SML sfrutta MiDaS come spina dorsale del codificatore. Nella pipeline modulare, VI-Depth combina la stima della profondità basata sui dati con il modello di previsione della profondità relativa di MiDaS, insieme all'unità di misurazione del sensore IMU. La combinazione di fonti di dati consente a VI-Depth di generare una profondità metrica densa più affidabile per ogni pixel in un'immagine.










Hyundai Ioniq 9: dopo due settimane di test non avremmo voluto restituirla
LG UltraGear evo GM9: 27 pollici, 5K, Mini LED e Dual Mode
Motorola edge 70 Fusion FIFA World Cup 26 Edition: un ottimo smartphone per i fan del calcio
Niente AI slop per Oracle: blocco totale ai contributi scritti con l'intelligenza artificiale su OpenJDK
Canon RF 300-600mm f/5.6L: forse a settembre, dopo anni di voci
Dreame Aqua10 Ultra Roller Complete torna al minimo storico: 699€ per il robot con 30.000 Pa
MOVA Z70 Ultra Roller Complete a 999€: robot aspirapolvere top di gamma con 36.000 Pa, -400€ rispetto al listino
L'IA di Google ha previsto l'uragano peggiore possibile con un anticipo di cinque giorni
ChatGPT potrebbe presto creare sticker personalizzati ed esportarli direttamente su WhatsApp
Il CEO di Take-Two: i dischi non hanno molto senso per il consumatore
Boato in garage e fiamme in casa: Tesla esplode durante l'intervento dei soccorritori
Panasonic ha invalidato il brevetto RAW di RED: nel 2019 Apple aveva fallito
Il MacBook Neo da 8 GB ha spinto Microsoft a ottimizzare Windows 11
Questo TV 4K di LG da 55 pollici e con tecnologia NanoCell scende a soli 347€
ByteDance addestra un modello da 10.000 miliardi di parametri per sfidare Mythos
OPPO Reno 16: milioni di microlenti per 15 mm di profondità sulla cover
Il mercato dei TV è fermo, ma gli OLED crescono del 20%









0 Commenti
Gli autori dei commenti, e non la redazione, sono responsabili dei contenuti da loro inseriti - infoDevi effettuare il login per poter commentare
Se non sei ancora registrato, puoi farlo attraverso questo form.
Se sei già registrato e loggato nel sito, puoi inserire il tuo commento.
Si tenga presente quanto letto nel regolamento, nel rispetto del "quieto vivere".