• Γ.Δ.ΓΕΝ. ΔΕΙΚΤΗΣ0,000%
  • S&P 5000,000%
  • Nasdaq0,000%
  • FTSE 1000,000%
  • Nikkei 2250,000%
  • DAX0,000%
  • CAC 400,000%
  • €/$
  • €/£
  • BTC
WSJ: Το επόμενο μεγάλο «άλμα» της Τεχνητής Νοημοσύνης είναι στον πραγματικό κόσμο
20:55 - 23 Αυγ 2026

WSJ: Το επόμενο μεγάλο «άλμα» της Τεχνητής Νοημοσύνης είναι στον πραγματικό κόσμο

Από τα μεγάλα γλωσσικά μοντέλα στα «world models», η τεχνητή νοημοσύνη επιχειρεί να περάσει από την επεξεργασία λέξεων στη δράση στον πραγματικό κόσμο. Νέα μοντέλα εκπαιδεύονται μέσω βιντεοπαιχνιδιών και προσομοιώσεων, ώστε να μπορούν να αντιλαμβάνονται τρισδιάστατα περιβάλλοντα, να λαμβάνουν αποφάσεις και να καθοδηγούν αυτόνομα ρομπότ, ανοίγοντας ένα νέο μέτωπο στον αγώνα για την επόμενη γενιά AI.

Τα σημερινά μεγάλα γλωσσικά μοντέλα (LLM) μπορεί να είναι εξαιρετικά στην επεξεργασία κειμένου, όμως για να μπορέσει η τεχνητή νοημοσύνη να εκτελεί πραγματικές εργασίες στον φυσικό κόσμο, οι ειδικοί στρέφονται σε μια νέα κατηγορία συστημάτων: τα μοντέλα δράσης (action models), γνωστά και ως world models.

Όπως αναφέρει η Wall Street Journal (WSJ), σε αντίθεση με τα LLM, τα οποία εκπαιδεύονται κυρίως σε κείμενα, κώδικα και εικόνες, τα world models εκπαιδεύονται μέσω βιντεοπαιχνιδιών και προσομοιώσεων. Στόχος είναι να μπορούν να αντιλαμβάνονται έναν τρισδιάστατο χώρο, να προβλέπουν τι θα συμβεί μετά από μια ενέργεια και να κατευθύνουν αυτόνομα ρομπότ.

Η τεχνολογία βρίσκεται ακόμη σε πρώιμο στάδιο. Ο Moritz Baier-Lentz, επενδυτής σε εταιρείες του κλάδου, εκτιμά ότι αν συγκριθεί με την εξέλιξη των LLM, βρίσκεται περίπου στο επίπεδο του GPT-2, του μοντέλου που κυκλοφόρησε η OpenAI το 2019. Παρά την ανωριμότητά της, όμως, προσελκύει ήδη σημαντικές επενδύσεις, καθώς θεωρείται πιθανό να ανοίξει έναν νέο δρόμο για την AI.

Από τις λέξεις στον πραγματικό κόσμο

Η βασική ιδέα είναι ότι το κείμενο δεν αποτελεί πλήρη αναπαράσταση της πραγματικότητας. «Το κείμενο είναι απλώς μια απωλεστική αναπαράσταση του πραγματικού κόσμου», λέει ο Kent Rollins, επικεφαλής προϊόντος της General Intuition και πρώην διευθυντής του οικοσυστήματος Fortnite στην Epic Games.

Η General Intuition, startup με έδρα τη Νέα Υόρκη, αναπτύσσει ένα action model που επεξεργάζεται την εικόνα από την κάμερα ενός ρομπότ και αποφασίζει την επόμενη κίνησή του. Η εταιρεία ολοκληρώνει επενδυτικό γύρο που θα μπορούσε να την αποτιμήσει σε πάνω από 6 δισ. δολάρια, γεγονός που θα την καθιστούσε το πολυτιμότερο AI lab αυτού του είδους.

Το μοντέλο της εκπαιδεύεται σε εκατομμύρια ώρες βιντεοπαιχνιδιών από πραγματικούς χρήστες μέσω της πλατφόρμας Medal.tv. Το σύστημα δεν μαθαίνει μόνο να «βλέπει» τι συμβαίνει στην οθόνη, αλλά συνδέει τις ενέργειες του παίκτη με τις συνέπειές τους στον εικονικό κόσμο. Έτσι, δημιουργείται ένα μεγάλο action model, το οποίο μπορεί να χρησιμοποιήσει αυτή τη γνώση για να αποφασίζει πώς θα κινηθεί ένα ρομπότ.

Με περιορισμένο fine-tuning, η τεχνολογία μπορεί στη συνέχεια να χρησιμοποιηθεί για τον χειρισμό ρομπότ στον πραγματικό κόσμο. Προς το παρόν, αφορά κυρίως τετράποδα ρομπότ, τροχοφόρα οχήματα και drones που μπορούν να ελέγχονται μέσω χειριστηρίου, ποντικιού ή πληκτρολογίου, αφήνοντας εκτός τα περισσότερα ανθρωποειδή ρομπότ.

Η General Intuition παρουσιάζει ήδη ένα ρομποτικό σκυλί που, σύμφωνα με την εταιρεία, χρειάζεται μόλις λίγα λεπτά fine-tuning για να προσαρμοστεί. Το σύστημα πρέπει να γνωρίζει πού βρίσκεται, τι είδους «σώμα» διαθέτει και ποιος είναι ο στόχος του. Από εκεί και πέρα μπορεί να αναλάβει την κίνηση του ρομπότ.

Η νέα γενιά world models

Η προσέγγιση αυτή διαφέρει από προηγούμενα world models, όπως τα Genie της Google DeepMind, τα οποία επικεντρώνονταν στη δημιουργία εικονικών κόσμων για την εκπαίδευση ρομπότ. Η νέα γενιά επιχειρεί να κάνει κάτι περισσότερο: να αντιλαμβάνεται το περιβάλλον και να αποφασίζει αυτόνομα την επόμενη ενέργεια.

Στον χώρο δραστηριοποιείται και η Emulate, με έδρα το Λονδίνο, που συνίδρυσε ο Jack Parker-Holder, πρώην επικεφαλής των σχετικών προσπαθειών της Google. Η startup βρίσκεται σε συζητήσεις για άντληση άνω των 500 εκατ. δολαρίων, ενώ στην ομάδα της συμμετέχουν αρκετοί πρώην εργαζόμενοι της Google.

Παράλληλα, η World Labs της Fei-Fei Li εξαγόρασε πρόσφατα την εταιρεία ρομποτικής Scenix, ενώ η AMI Labs, υπό τον πρώην επικεφαλής AI της Meta, Yann LeCun, εξετάζει διαφορετικές αρχιτεκτονικές πέρα από τα παραδοσιακά LLM.

Το μεγάλο στοίχημα: LLM και world models μαζί

Το ερώτημα πλέον δεν αφορά μόνο το αν τα world models μπορούν να οδηγήσουν ρομπότ, αλλά και το πώς θα μπορούσαν να συνεργαστούν με τα LLM.

Τα LLM μπορούν να επεξεργάζονται εικόνες και ήχο, εφόσον εκπαιδευτούν απευθείας σε αυτά τα δεδομένα, μετατρέποντάς τα σε tokens, όπως κάνουν με τις λέξεις. Ωστόσο, η επεξεργασία μιας τρισδιάστατης σκηνής με τον ίδιο τρόπο αποδεικνύεται ιδιαίτερα απαιτητική και μπορεί να οδηγήσει σε συστήματα πολύ αργά για εφαρμογές ρομποτικής.

Μια πιθανή λύση είναι ένα υβριδικό μοντέλο, στο οποίο τα LLM θα χρησιμοποιούν world models ως εξειδικευμένα εργαλεία, όπως ήδη χρησιμοποιούν άλλα λογισμικά για να ολοκληρώνουν συγκεκριμένες εργασίες.

Υπάρχει, ωστόσο, ένα κρίσιμο πρόβλημα: τα λάθη που είναι ανεκτά σε ένα chatbot μπορεί να αποδειχθούν επικίνδυνα όταν ένα AI ελέγχει ένα ρομπότ. Όπως επισημαίνει ο καθηγητής ρομποτικής George Konidaris, «ο πραγματικός κόσμος είναι πολύ σύνθετος» και δεν υπάρχουν περιθώρια για προσεγγιστικά σωστές απαντήσεις. Ένα λάθος στην κίνηση ενός ρομπότ μπορεί να αλλάξει ολόκληρη την κατάσταση.

Η διαφορά αυτή είναι σημαντική. Ένα LLM μπορεί να κάνει λάθος σε μια απάντηση χωρίς να προκύψει άμεση φυσική συνέπεια. Ένα ρομπότ, όμως, που θα κινηθεί προς τη λάθος κατεύθυνση ή θα συγκρουστεί με ένα αντικείμενο μπορεί να προκαλέσει πραγματική ζημιά.

Παρά τις δυσκολίες, οι επενδύσεις δείχνουν ότι η βιομηχανία βλέπει στα world models μια πιθανή νέα φάση εξέλιξης της τεχνητής νοημοσύνης. Η βασική φιλοδοξία είναι να δημιουργηθούν συστήματα που δεν θα περιορίζονται στην κατανόηση και παραγωγή λέξεων, αλλά θα μπορούν να αντιλαμβάνονται τον χώρο, να κατανοούν τη σχέση αιτίας και αποτελέσματος και να ενεργούν μέσα στον φυσικό κόσμο.

Ο στόχος, πάντως, δεν είναι απαραίτητα η πολυσυζητημένη «υπερευφυΐα».

Όπως λέει ο CEO της General Intuition, Pim de Witte: «Είμαι στη Νέα Υόρκη επειδή θέλω να μείνω μακριά από όλη αυτή τη συμπεριφορά που θυμίζει αίρεση και απλώς να επικεντρωθώ στην επιστημονική αξιολόγηση των δυνατοτήτων των μοντέλων στα ρομπότ. Δεν χρειάζεται να το κάνουμε κάτι περισσότερο από αυτό που είναι».

Τελευταία τροποποίηση στις 23/08/2026 - 20:35