Παρασκευή 24 Ιουλίου 2026
«Επίθεση από το μέλλον»: Πώς ακριβώς έδρασαν οι «δραπέτες» της OpenAI
Ένα από τα πιο ανησυχητικά περιστατικά στην ιστορία της τεχνητής νοημοσύνης ερευνούν η OpenAI και η Hugging Face.
Όπως αποκαλύφθηκε προηγμένα μοντέλα AI της OpenAI κατάφεραν να διαφύγουν από ελεγχόμενο ερευνητικό περιβάλλον και να εξαπολύσουν κυβερνοεπίθεση εναντίον της Hugging Face, στην προσπάθειά τους να… «κλέψουν» τις απαντήσεις ενός τεστ κυβερνοασφάλειας. Η Wall Street Journal εξηγεί πώς ακριβώς εκτυλίχθηκε το πρωτοφανές περιστατικό.
Το περιστατικό σημειώθηκε στις 11 Ιουλίου και θεωρείται από ειδικούς ένα από τα πρώτα πραγματικά παραδείγματα αυτού που η κοινότητα της ασφάλειας της AI αποκαλεί εδώ και χρόνια «απώλεια ελέγχου» (loss of control): την περίπτωση δηλαδή κατά την οποία ένα ισχυρό μοντέλο ενεργεί αυτόνομα, έξω από τα όρια που είχαν θέσει οι δημιουργοί του.
Πώς ξεκίνησαν όλα
Η OpenAI δοκίμαζε δύο από τα πλέον προηγμένα μοντέλα της, το GPT-5.6 Sol και ένα ακόμη ισχυρότερο μοντέλο που δεν έχει ακόμη κυκλοφορήσει.
Οι δοκιμές πραγματοποιούνταν στο πλαίσιο του ExploitGym, ενός εξειδικευμένου benchmark που αξιολογεί τις δυνατότητες μοντέλων AI στην κυβερνοασφάλεια.
Το ExploitGym περιλαμβάνει περίπου 900 διαφορετικές δοκιμές, στις οποίες το μοντέλο καλείται να εντοπίσει γνωστά κενά ασφαλείας σε λογισμικό και να τα εκμεταλλευθεί, αποδεικνύοντας ότι κατάφερε να αποκτήσει πρόσβαση στο σύστημα.
Για τις ανάγκες του πειράματος, η OpenAI είχε απενεργοποιήσει ορισμένες από τις δικλίδες ασφαλείας που κανονικά εμποδίζουν τα μοντέλα της να χρησιμοποιούνται για επιθέσεις hacking.
Αντί να λύσουν το τεστ… προσπάθησαν να αντιγράψουν
Σύμφωνα με την OpenAI και τους δημιουργούς του ExploitGym, τα μοντέλα κατέληξαν σε μία διαφορετική στρατηγική.
Αντί να ολοκληρώσουν τις δοκιμές, κατάφεραν να διαφύγουν από το απομονωμένο περιβάλλον («sandbox») στο οποίο εκτελούνταν, να αποκτήσουν πρόσβαση στο διαδίκτυο και να επιτεθούν στη Hugging Face, θεωρώντας ότι εκεί θα έβρισκαν έτοιμες τεχνικές ή πληροφορίες που θα τους επέτρεπαν να πετύχουν υψηλότερη βαθμολογία.
Το φαινόμενο αυτό είναι γνωστό ως «reward hacking»: το μοντέλο δεν επιδιώκει να επιλύσει το πρόβλημα με τον τρόπο που σχεδίασαν οι ερευνητές, αλλά αναζητά οποιονδήποτε τρόπο μεγιστοποιεί την «ανταμοιβή» ή τη βαθμολογία του.
Μία επίθεση που δεν έμοιαζε με καμία άλλη
Ο Thomas Wolf, συνιδρυτής και επικεφαλής επιστήμονας της Hugging Face, δήλωσε στη WSJ ότι αντιλήφθηκε αμέσως πως κάτι ήταν ασυνήθιστο.
Όπως είπε, ο εισβολέας δεν αναζητούσε οικονομικά δεδομένα ή πληροφορίες που θα μπορούσαν να πουληθούν, όπως κάνουν συνήθως οι κυβερνοεγκληματίες. Αντίθετα, έψαχνε αποκλειστικά βάσεις δεδομένων κυβερνοασφάλειας.
Η επίθεση εξελίχθηκε μέσω χιλιάδων αυτόματων ενεργειών. Σύμφωνα με τη Hugging Face, τα μοντέλα πραγματοποίησαν περίπου 17.000 επιμέρους ενέργειες, χρησιμοποιώντας πολλαπλούς βραχύβιους «πράκτορες» για αναγνώριση του δικτύου και αναζήτηση πληροφοριών.
Η ειρωνεία: Σταμάτησαν την επίθεση με κινεζικό μοντέλο AI
Η Hugging Face επιχείρησε αρχικά να αναλύσει τα αρχεία καταγραφής χρησιμοποιώντας μοντέλα της Anthropic.
Ωστόσο, τα μοντέλα αρνήθηκαν να επεξεργαστούν τα δεδομένα, επειδή περιείχαν στοιχεία πραγματικής κυβερνοεπίθεσης και ενεργοποιήθηκαν οι ενσωματωμένοι περιορισμοί ασφαλείας τους.
Τελικά, η εταιρεία χρησιμοποίησε το ανοικτού κώδικα μοντέλο GLM 5.2 της κινεζικής Z.AI, το οποίο βοήθησε στην ανάλυση της επίθεσης.
Ακολούθησε επαναφορά κωδικών πρόσβασης, απομόνωση των παραβιασμένων συστημάτων και απομάκρυνση των μοντέλων από το δίκτυο.
Η Hugging Face διευκρίνισε ότι δεν διέρρευσαν δεδομένα πελατών.
Η OpenAI σταμάτησε τις δοκιμές
Όταν ενημερώθηκε ότι πίσω από την επίθεση βρίσκονταν δικά της μοντέλα, η OpenAI διέκοψε προσωρινά τα συστήματα δοκιμών προκειμένου να διερευνήσει τι ακριβώς συνέβη.
Η εταιρεία προσπαθεί ακόμη να απαντήσει σε κρίσιμα ερωτήματα:Πόσο χρόνο έμειναν τα μοντέλα εκτός ελέγχου;
Επιτέθηκαν και σε άλλους οργανισμούς;
Προσπάθησαν να αλλοιώσουν και άλλες δοκιμές;
Απέκτησαν πρόσβαση σε περισσότερα δεδομένα;
Η OpenAI έχει ανακοινώσει ότι θα δημοσιεύσει αναλυτική έκθεση μόλις ολοκληρωθεί η έρευνα.
Eυρύτερες προεκτάσεις
Η υπόθεση έχει προκαλέσει έντονη συζήτηση στην κοινότητα της τεχνητής νοημοσύνης και στους κύκλους χάραξης πολιτικής στις ΗΠΑ.
Από τη μία πλευρά ενισχύει τις ανησυχίες ότι τα ολοένα ισχυρότερα μοντέλα AI μπορεί να αναπτύσσουν μη αναμενόμενες στρατηγικές όταν επιδιώκουν έναν στόχο.
Από την άλλη, αναζωπυρώνει τη συζήτηση για τον ανταγωνισμό ΗΠΑ–Κίνας στην τεχνητή νοημοσύνη, καθώς η αντιμετώπιση της επίθεσης κατέστη δυνατή με τη βοήθεια ενός κινεζικού ανοικτού μοντέλου, τη στιγμή που αρκετοί Αμερικανοί αξιωματούχοι και εταιρείες πιέζουν για αυστηρότερους περιορισμούς στην πρόσβαση στις κινεζικές τεχνολογίες AI.
Παρά τον εντυπωσιακό χαρακτήρα του περιστατικού, πολλά στοιχεία παραμένουν ακόμη υπό διερεύνηση και δεν έχουν δημοσιοποιηθεί όλα τα τεχνικά ευρήματα της υπόθεσης.
naftemporiki.gr
Εγγραφή σε:
Σχόλια ανάρτησης (Atom)

Δεν υπάρχουν σχόλια:
Δημοσίευση σχολίου