Τα νέα μοντέλα τεχνητής νοημοσύνης της Google DeepMind βοηθούν τα ρομπότ να εκτελούν φυσικές εργασίες

Ανακαλύψτε περισσότερα άρθρα στα αποτελέσματα αναζήτησης

Προσθήκη του VoiceNews στην Google

Η Google DeepMind λανσάρει δύο νέα μοντέλα τεχνητής νοημοσύνης που έχουν σχεδιαστεί για να βοηθήσουν τα ρομπότ «να εκτελούν ένα ευρύτερο φάσμα καθηκόντων στον πραγματικό κόσμο από ποτέ άλλοτε». Το πρώτο, που ονομάζεται Gemini Robotics, είναι ένα μοντέλο όρασης-γλώσσας-δράσης ικανό να κατανοεί νέες καταστάσεις, ακόμη και αν δεν έχει εκπαιδευτεί σε αυτές.

Το Gemini Robotics βασίζεται στο Gemini 2.0, την τελευταία έκδοση του κορυφαίου μοντέλου τεχνητής νοημοσύνης της Google. Κατά τη διάρκεια μιας συνέντευξης Τύπου, η Carolina Parada, ανώτερη διευθύντρια και επικεφαλής της ρομποτικής στο Google DeepMind, δήλωσε ότι το Gemini Robotics «αντλεί από την πολυτροπική κατανόηση του κόσμου του Gemini και τη μεταφέρει στον πραγματικό κόσμο προσθέτοντας φυσικές ενέργειες ως νέο τρόπο».

Το νέο μοντέλο κάνει προόδους σε τρεις βασικούς τομείς που σύμφωνα με την Google DeepMind είναι απαραίτητοι για την κατασκευή χρήσιμων ρομπότ: γενικότητα, διαδραστικότητα και επιδεξιότητα. Εκτός από την ικανότητα γενίκευσης νέων σεναρίων, το Gemini Robotics είναι καλύτερο στην αλληλεπίδραση με τους ανθρώπους και το περιβάλλον τους. Είναι επίσης ικανό να εκτελεί πιο ακριβείς φυσικές εργασίες, όπως το δίπλωμα ενός χαρτιού ή η αφαίρεση ενός καπακιού μπουκαλιού.

«Ενώ έχουμε σημειώσει πρόοδο σε καθέναν από αυτούς τους τομείς ξεχωριστά στο παρελθόν με τη γενική ρομποτική, φέρνουμε [δραστική] αύξηση των επιδόσεων και στους τρεις τομείς με ένα μόνο μοντέλο», δήλωσε ο Parada. «Αυτό μας επιτρέπει να κατασκευάζουμε ρομπότ που είναι πιο ικανά, που ανταποκρίνονται καλύτερα και που είναι πιο ανθεκτικά στις αλλαγές του περιβάλλοντός τους».

Η Google DeepMind λανσάρει επίσης το Gemini Robotics-ER (ή embodied reasoning), το οποίο η εταιρεία περιγράφει ως ένα προηγμένο μοντέλο οπτικής γλώσσας που μπορεί να «κατανοήσει τον πολύπλοκο και δυναμικό κόσμο μας».

Όπως εξηγεί ο Parada, όταν ετοιμάζετε ένα κουτί φαγητού και έχετε αντικείμενα σε ένα τραπέζι μπροστά σας, θα πρέπει να ξέρετε πού βρίσκονται όλα, καθώς και πώς να ανοίξετε το κουτί φαγητού, πώς να πιάσετε τα αντικείμενα και πού να τα τοποθετήσετε. Αυτό το είδος συλλογισμού αναμένεται να κάνει το Gemini Robotics-ER. Έχει σχεδιαστεί για τους ρομποτιστές ώστε να συνδεθούν με τους υπάρχοντες ελεγκτές χαμηλού επιπέδου – το σύστημα που ελέγχει τις κινήσεις ενός ρομπότ – επιτρέποντάς τους να ενεργοποιήσουν νέες δυνατότητες που τροφοδοτούνται από το Gemini Robotics-ER.

Όσον αφορά την ασφάλεια, ο ερευνητής της Google DeepMind, Vikas Sindhwani, δήλωσε στους δημοσιογράφους ότι η εταιρεία αναπτύσσει μια «πολυεπίπεδη προσέγγιση», προσθέτοντας ότι τα μοντέλα του Gemini Robotics-ER «εκπαιδεύονται για να αξιολογούν αν μια πιθανή ενέργεια είναι ασφαλές να εκτελεστεί σε ένα δεδομένο σενάριο». Η εταιρεία δημοσιεύει επίσης νέα σημεία αναφοράς και πλαίσια για να βοηθήσει στην περαιτέρω έρευνα για την ασφάλεια στον κλάδο της τεχνητής νοημοσύνης. Πέρυσι, η Google DeepMind παρουσίασε το «Robot Constitution», ένα σύνολο κανόνων εμπνευσμένων από τον Ισαάκ Ασίμοφ, που πρέπει να ακολουθούν τα ρομπότ της.

Η Google DeepMind συνεργάζεται με την Apptronik για την «κατασκευή της επόμενης γενιάς ανθρωποειδών ρομπότ». Δίνει επίσης πρόσβαση σε «έμπιστους δοκιμαστές» στο μοντέλο Gemini Robotics-ER, συμπεριλαμβανομένων των Agile Robots, Agility Robotics, Boston Dynamics και Enchanted Tools. «Είμαστε πολύ επικεντρωμένοι στην οικοδόμηση της νοημοσύνης που θα είναι σε θέση να κατανοήσει τον φυσικό κόσμο και να είναι σε θέση να δράσει σε αυτόν τον φυσικό κόσμο», δήλωσε ο Parada. «Είμαστε πολύ ενθουσιασμένοι που βασικά θα το αξιοποιήσουμε αυτό σε πολλαπλές υλοποιήσεις και πολλές εφαρμογές για εμάς».

Πηγή The Verge