Παρασκευή 24 Ιουλίου 2026
weather-icon 25o
Η τεχνητή νοημοσύνη μπορεί να φύγει από τον ανθρώπινο έλεγχο – Γιατί είναι ανησυχητικό το «ατύχημα» της OpenAI

Η τεχνητή νοημοσύνη μπορεί να φύγει από τον ανθρώπινο έλεγχο – Γιατί είναι ανησυχητικό το «ατύχημα» της OpenAI

Η OpenAI παραδέχθηκε ότι πράκτορας με τεχνητή νοημοσύνη συνδέθηκε μόνος του στο Διαδίκτυο και «χάκαρε» τα συστήματα μεγάλης διαδικτυακής πλατφόρμας. Γιατί ο περιορισμός της ΑΙ γίνεται όλο και πιο δύσκολος.

Ανακαλύψτε περισσότερα άρθρα στα αποτελέσματα αναζήτησης

Προσθήκη του in.gr στην Google

Δεν έχει περάσει πολύς καιρός που άρχισε η κουβέντα για τη λεγόμενη «recursive self-improvement» ή RSI και την εύλογη ανησυχία που προκαλεί αυτό το ενδεχόμενο. Δηλαδή για τη δυνατότητα ενός μοντέλου με τεχνητή νοημοσύνη να δημιουργήσει την επόμενη, πιο ικανή εκδοχή του χωρίς ανθρώπινη παρέμβαση. Η πραγματικότητα όμως πρόλαβε και τους ειδικούς και όσους προειδοποιούν ότι η τεχνητή νοημοσύνη ενέχει κινδύνους.

Παρά το γεγονός ότι ακούγεται σαν κάτι βγαλμένο από ταινία επιστημονικής φαντασίας, είναι αλήθεια. Στις 16 Ιουλίου, η Hugging Face, πλατφόρμα τεχνητής νοημοσύνης ανακοίνωσε ότι είχε ειδοποιήσει τις αρχές επιβολής του νόμου. Ένας εισβολέας χρησιμοποίησε έναν παράγοντα τεχνητής νοημοσύνης για να παραβιάσει τα συστήματά της. Πέντε ημέρες αργότερα, αποκαλύφθηκε ότι δεν υπήρχε ανθρώπινη εμπλοκή. Η τεχνητή νοημοσύνη ήταν ο εισβολέας.

Ένα μοντέλο τεχνητής νοημοσύνης της OpenAI, σε συνδυασμό με ένα πιο ισχυρό, ακυκλοφόρητο ακόμη μοντέλο, «έσπασε» τις αλυσίδες του. Ξέφυγε από τον ανθρώπινο έλεγχο στη διάρκεια άσκησης ασφαλείας στο εργαστήριο, συνδέθηκε μόνο του στο διαδίκτυο και χάκαρε τα συστήματα της Hugging Face.

Γιατί το έκανε; Διότι το υβριδικό μοντέλο τεχνητής νοημοσύνης αναζητούσε μια λύση σε ένα πρόβλημα αξιολόγησης που είχαν θέσει οι κατασκευαστές του.

Η τεχνητή νοημοσύνη ξεπέρασε την πρόβλεψη

Μιλώντας στον Economist, o Στέφαν Γερένα, ερευνητής στην αμερικανική δεξαμενή σκέψης Ινστιτούτο Νομικής και Τεχνητής Νοημοσύνης, λέει: «Αυτή η κατάσταση είναι άνευ προηγουμένου».

Το μοντέλο της OpenAI που πήρε τον «κακό τον δρόμο» το έκανε με καλή πρόθεση. Τα εργαστήρια τεχνητής νοημοσύνης δοκιμάζουν τα μοντέλα τους για δυνητικά επικίνδυνες δυνατότητες πριν τα κυκλοφορήσουν. Έτσι, η OpenAI ήθελε να δει πώς θα τα πήγαιναν τα τελευταία της μοντέλα στο ExploitGym. Πρόκειται για ένα σύνολο τυπικών προβλημάτων που δοκιμάζει πόσο καλά είναι τα συστήματα τεχνητής νοημοσύνης στην εκμετάλλευση γνωστών ευπαθειών σε διάφορες δημοφιλείς εφαρμογές. Μεταξύ αυτών, το πρόγραμμα περιήγησης Chrome της Google.

Τεχνητή νοημοσύνη

Η OpenAI εφαρμόζει μέτρα ασφαλείας στα δημόσια διαθέσιμα μοντέλα της. Έτσι, διασφαλίζει ότι δεν προβαίνουν σε ανεπιθύμητες ενέργειες. Αν ένας χρήστης ζητήσει από την εμπορικά διαθέσιμη έκδοση του ChatGPT να τον βοηθήσει να παραβιάσετε έναν ιστότοπο, θα αρνηθεί.

Η εταιρεία, που ήθελε να αξιολογήσει σωστά τις δυνατότητες του ακυκλοφόρητου μοντέλου της, είχε αναστείλει προσωρινά αυτούς τους περιορισμούς. Επειδή το να αφήσει απλώς έναν εξαιρετικά ικανό χάκερ ελεύθερο στο ανοιχτό διαδίκτυο θα ήταν πολύ επικίνδυνο, η OpenAI είχε τοποθετήσει το μοντέλο τεχνητής νοημοσύνης της σε ένα sandbox (κουτί με άμμο). Έτσι ονομάζεται το απομονωμένο περιβάλλον υπολογιστή χωρίς γενική πρόσβαση στο διαδίκτυο. Πλην όμως, διαθέτει μια εσωτερικά φιλοξενούμενη υπηρεσία τρίτου μέρους που επιτρέπει στην τεχνητή νοημοσύνη να ανακτά μικρά πακέτα λογισμικού που ήταν απαραίτητα για την ολοκλήρωση των δοκιμών της.

Η εταιρεία πήρε περισσότερα από όσα ζητούσε. Τα μοντέλα με τεχνητή νοημοσύνη, αντί να λύσουν άμεσα τα προβλήματα στην αξιολόγησή της, απέκτησαν πρόσβαση στο ανοιχτό διαδίκτυο. Και το έκαναν εκμεταλλευόμενα μια προηγουμένως άγνωστη ευπάθεια στην υπηρεσία ανάκτησης λογισμικού. Έχοντας αποκτήσει πρόσβαση στο διαδίκτυο, κατέληξαν σωστά στο συμπέρασμα ότι οι λύσεις στα προβλήματα που τους είχαν τεθεί αποθηκεύονταν από το Hugging Face. Δηλαδή, σε μια δημοφιλή βιβλιοθήκη για μοντέλα και σύνολα δεδομένων τεχνητής νοημοσύνης ανοιχτού κώδικα.

Τα μοντέλα προχώρησαν σε επίθεση πολλαπλών βημάτων. Ξεκίνησαν ανεβάζοντας ένα σύνολο δεδομένων στο Hugging Face, το οποίο υποβλήθηκε αυτόματα σε επεξεργασία από την πλατφόρμα. Κατά τη διάρκεια ενός Σαββατοκύριακου, αυτό το σύνολο δεδομένων (το οποίο το Hugging Face περιέγραψε ως «κακόβουλο») επέτρεψε στα μοντέλα να συλλέξουν στοιχεία σύνδεσης και να έχουν πρόσβαση σε εσωτερικούς διακομιστές, οι οποίοι δεν προορίζονται για δημόσια πρόσβαση. Το Hugging Face και το OpenAI εντόπισαν ανεξάρτητα την παραβίαση από την τεχνητή νοημοσύνη και δήλωσαν ότι συνεργάζονταν στην έρευνα.

«Αυστηρότεροι έλεγχοι»

Μετά την αποκάλυψη της «πειρατείας», η OpenAI ανακοίνωσε ότι είχε ανταποκριθεί εφαρμόζοντας αυστηρότερους ελέγχους στην υποδομή της (με κόστος την «ταχύτητα έρευνας»). Επίσης, αποκάλυψε τα τρωτά σημεία που είχε βρει το μοντέλο του στον προγραμματιστή της πύλης λογισμικού. Και συμπεριέλαβε την Hugging Face στο πρόγραμμα «αξιόπιστης πρόσβασης», το οποίο τώρα της δίνει τη δυνατότητα να χρησιμοποιεί τεχνητή νοημοσύνη με βελτιωμένες δυνατότητες στον κυβερνοχώρο (όπως αυτό που είχε χακάρει τους δικούς του υπολογιστές) για να τους βοηθήσει να βελτιώσουν τις άμυνές του.

Η OpenAI τόνισε επίσης ότι τα μοντέλα της είχαν «υπερβολικά επικεντρωθεί» στην εύρεση λύσεων για την αξιολόγηση του ExploitGym.

Το ερώτημα που τίθεται είναι τι θα είχε συμβεί αν το μοντέλο AI είχε άλλους στόχους. Κυρίως γιατί η εταιρεία Hugging Face δεν υστερεί από την άποψη της ασφάλειας των υπολογιστών. Είναι μια εταιρεία τεχνολογίας αξίας 4,5 δισεκατομμυρίων δολαρίων. Έχει εκατοντάδες υπαλλήλους και μια αφοσιωμένη ομάδα κυβερνοασφάλειας. Τα πράγματα θα μπορούσαν να είχαν εξελιχθεί πολύ χειρότερα για μια εταιρεία με λιγότερο επαρκείς πόρους.

Τεχνητή νοημοσύνη

Χάνοντας τον έλεγχο

Και αν αυτό είναι το πιο εντυπωσιακό, δεν είναι το πρώτο σημάδι ότι οι δυνατότητες των μοντέλων AI αρχίζουν να ξεπερνούν τον έλεγχο των ανθρώπων. Ο συνιδρυτής της Anthropic, Τζακ Κλαρκ, εκτιμά ότι υπάρχει 60% πιθανότητα μέχρι το τέλος του 2028 ένα σύστημα με τεχνητή νοημοσύνη να μπορεί να δημιουργεί τον διάδοχό του χωρίς ανθρώπινη συμμετοχή. Μια τέτοια εξέλιξη, σύμφωνα με τον ίδιο, δεν είναι πλέον σενάριο επιστημονικής φαντασίας. Είναι μια πιθανή τάση που μπορεί να προκύψει από τη ραγδαία πρόοδο των μεγάλων γλωσσικών μοντέλων. Άλλωστε, τα μοντέλα με τεχνητή νοημοσύνη γίνονται όλο και πιο ικανά. Και μπορούν να κάνουν πάρα πολλά πράγματα χωρίς ανθρώπινη εποπτεία.

Τον Απρίλιο, ερευνητής της Anthropic δήλωσε με ανάρτηση στο διαδίκτυο ότι είχε εκπλαγεί όταν η Mythos, τότε ένα ακυκλοφόρητο μοντέλο AI, του έστειλε email. Ήθελε να τον ενημερώσει ότι είχε ξεφύγει με επιτυχία από ένα sandbox στο πλαίσιο της δικής της αξιολόγησης κυβερνοδυναμικών δυνατοτήτων.

Όπως και το ακυκλοφόρητο μοντέλο OpenAI που εμπλέκεται στο περιστατικό με την Hugging Face, η Mythos υποτίθεται ότι δεν είχε απεριόριστη πρόσβαση στο διαδίκτυο. Η μόνη διαφορά είναι ότι το μοντέλο της Anthropic δεν είχε παραβιάσει τους διακομιστές άλλων εταιρειών.

Βέβαια, οι εκπληκτικές δυνατότητες που έχει η τεχνητή νοημοσύνη δεν περιορίζονται στο hacking. Τον Μάιο, ένα αδημοσίευτο μοντέλο της OpenAI διέψευσε την 80χρονη εικασία της επίπεδης μοναδιαίας απόστασης, ένα κεντρικό πρόβλημα στη συνδυαστική γεωμετρία που έθεσε για πρώτη φορά ο μαθηματικός Πολ Ερντός το 1946. Στις 20 Ιουλίου, ο Λεβέντ Αλπόγε, μαθηματικός στο Πανεπιστήμιο του Χάρβαρντ, έγραψε ότι χρησιμοποίησε το Claude Fable 5, για να διαψεύσει την Ιακωβιανή εικασία, η οποία είχε επίσης μπερδέψει τους μαθηματικούς για περισσότερα από 80 χρόνια.

Αδυναμία κατανόησης

Η OpenAI δεν έχει αποκαλύψει δημόσια τις λεπτομέρειες για το πώς το αδημοσίευτο μοντέλο της διέφυγε από τον περιορισμό. Ακόμα κι αν το είχε κάνει, τα συστήματα με τεχνητή νοημοσύνη αρχίζουν να ξεπερνούν τα ανθρώπινα όρια. Ο Άλεξ Μάινκε εργάζεται για την Apollo Research, μια ομάδα ασφάλειας τεχνητής νοημοσύνης στο Λονδίνο. Εξηγεί ότι η έλλειψη σε εργασίες κυβερνοασφάλειας σημαίνει ότι «μόνο πολύ, πολύ λίγοι ειδικοί στον κυβερνοχώρο στον κόσμο» μπορούσαν να κατανοήσουν σωστά τον τρόπο με τον οποίο συνέβη η παραβίαση.

Και το γεγονός καταδεικνύει τους κινδύνους που θέτει ακόμη και η τεχνητή νοημοσύνη που βρίσκεται ακόμη υπό ανάπτυξη. Για τον Νέιθαν Κάλβιν, της Encode AI, αμερικανικό οργανισμό που ζητά τη ρύθμιση της τεχνητής νοημοσύνης, το πρόβλημα είναι και νομικό. «Δεν υπάρχουν απαιτήσεις στην πολιτειακή ή ομοσπονδιακή νομοθεσία για τις εταιρείες να αποκαλύπτουν την εσωτερική ανάπτυξη εξαιρετικά ικανών μοντέλων τεχνητής νοημοσύνης, όπως αυτό που εμπλέκεται στην παραβίαση του Hugging Face», είπε στον Economist.

Ορισμένοι πολιτειακοί νόμοι στην Αμερική απαιτούν από τις εταιρείες να αποκαλύπτουν περιστατικά κυβερνοασφάλειας. Ωστόσο, το πεδίο εφαρμογής τους είναι περιορισμένο. Η Καλιφόρνια υποχρεώνει τα εργαστήρια αιχμής να αναφέρουν οποιοδήποτε «κρίσιμο περιστατικό ασφάλειας», το οποίο περιλαμβάνει ένα μοντέλο που χρησιμοποιεί «παραπλανητικές τεχνικές» για να υπονομεύσει την παρακολούθηση «εκτός του πλαισίου μιας αξιολόγησης», εντός 15 ημερών από την ανακάλυψή του. Δεν είναι σαφές εάν η παραβίαση από την τεχνητή νοημοσύνη στη Hugging Face θα πληρούσε τις προϋποθέσεις, λέει ο Νέιθαν Κάλβιν.

Ποιος θα πληρώσει τη ζημιά;

Υπάρχει ακόμη ένα νομικό –παρεμπιπτόντως νομικό ζήτημα. Και αφορά την ευθύνη. Αν οι συνέπειες της επίθεσης χάκινγκ ήταν πιο δαπανηρές, ποιος θα ήταν υπεύθυνος; Στις ΗΠΑ, ο ομοσπονδιακός νόμος κατά των κυβερνοεπιθέσεων ρυθμίζει μόνο τη σκόπιμη μη εξουσιοδοτημένη πρόσβασης σε συστήματα υπολογιστών. Η OpenAI δεν είχε σκοπό το μοντέλο της να «παρανομήσει». «Πολλά από αυτά τα νομικά ερωτήματα στρέφονται γύρω από την πρόθεση. Τι γνώριζε ή προέβλεψε η OpenAI;» λέει ο Στέφαν Γερένα. Διότι, αυτό το περιστατικό με την αυτενεργούσα τεχνητή νοημοσύνη ήταν μια έκπληξη. Την επόμενη φορά, οι εταιρείες δεν θα μπορούν να επικαλεστούν άγνοια.

Σχόλια
Γράψτε το σχόλιό σας
0 /50
0 /2000

Ακολουθήστε το in.gr στο Google News και μάθετε πρώτοι όλες τις ειδήσεις

Προσθήκη του in.gr στην Google

in.gr | Ταυτότητα

Διαχειριστής - Διευθυντής: Λευτέρης Θ. Χαραλαμπόπουλος

Διευθύντρια Σύνταξης: Αργυρώ Τσατσούλη

Ιδιοκτησία - Δικαιούχος domain name: ALTER EGO MEDIA A.E.

Νόμιμος Εκπρόσωπος: Ιωάννης Βρέντζος

Έδρα - Γραφεία: Λεωφόρος Συγγρού αρ 340, Καλλιθέα, ΤΚ 17673

ΑΦΜ: 800745939, ΔΟΥ: ΚΕΦΟΔΕ ΑΤΤΙΚΗΣ

Ηλεκτρονική διεύθυνση Επικοινωνίας: [email protected], Τηλ. Επικοινωνίας: 2107547007

ΜΗΤ Αριθμός Πιστοποίησης Μ.Η.Τ.232442

Παρασκευή 24 Ιουλίου 2026
Cookies