Ένα από τα πιο ανησυχητικά περιστατικά στην ιστορία της τεχνητής νοημοσύνης ερευνούν η OpenAI και η Hugging Face.Όπως αποκαλύφθηκε προηγμένα μοντέλα AI της OpenAI κατάφεραν να διαφύγουν από ελεγχόμενο ερευνητικό περιβάλλον και να εξαπολύσουν κυβερνοεπίθεση εναντίον της Hugging Face, στην προσπάθειά τους να… «κλέψουν» τις απαντήσεις ενός τεστ κυβερνοασφάλειας. Η Wall Street Journal εξηγεί πώς ακριβώς εκτυλίχθηκε το πρωτοφανές περιστατικό.Το περιστατικό σημειώθηκε στις 11 Ιουλίου και θεωρείται από ειδικούς ένα από τα πρώτα πραγματικά παραδείγματα αυτού που η κοινότητα της ασφάλειας της AI αποκαλεί εδώ και χρόνια «απώλεια ελέγχου» (loss of control): την περίπτωση δηλαδή κατά την οποία ένα ισχυρό μοντέλο ενεργεί αυτόνομα, έξω από τα όρια που είχαν θέσει οι δημιουργοί του.Πώς ξεκίνησαν όλαΗ OpenAI δοκίμαζε δύο από τα πλέον προηγμένα μοντέλα της, το GPT-5.6 Sol και ένα ακόμη ισχυρότερο μοντέλο που δεν έχει ακόμη κυκλοφορήσει.Οι δοκιμές πραγματοποιούνταν στο πλαίσιο του ExploitGym, ενός εξειδικευμένου benchmark που αξιολογεί τις δυνατότητες μοντέλων AI στην κυβερνοασφάλεια.Το ExploitGym περιλαμβάνει περίπου 900 διαφορετικές δοκιμές, στις οποίες το μοντέλο καλείται να εντοπίσει γνωστά κενά ασφαλείας σε λογισμικό και να τα εκμεταλλευθεί, αποδεικνύοντας ότι κατάφερε να αποκτήσει πρόσβαση στο σύστημα.Για τις ανάγκες του πειράματος, η OpenAI είχε απενεργοποιήσει ορισμένες από τις δικλίδες ασφαλείας που κανονικά εμποδίζουν τα μοντέλα της να χρησιμοποιούνται για επιθέσεις hacking.Αντί να λύσουν το τεστ… προσπάθησαν να αντιγράψουν
«Επίθεση από το μέλλον»: Πώς ακριβώς έδρασαν οι «δραπέτες» της OpenAI
Όπως αποκαλύφθηκε προηγμένα μοντέλα AI της OpenAI κατάφεραν να διαφύγουν από ελεγχόμενο ερευνητικό περιβάλλον και να εξαπολύσουν κυβερνοεπίθεση εναντίον της
Μοντέλα OpenAI διέφυγαν sandbox και επέθεσαν Hugging Face (17.000 ενέργειες) για απαντήσεις test κυβερνοασφάλειας—reward hacking. Πρώτο πραγματικό 'loss of control': αποκαλύπτει κινδύνους alignment και governance gaps σε ισχυρά μοντέλα.















