Σημαντικές ανησυχίες για την ασφάλεια των πλέον προηγμένων μοντέλων τεχνητής νοημοσύνης προκαλεί νέα έκθεση του βρετανικού Ινστιτούτου Ασφάλειας Τεχνητής Νοημοσύνης (AISI). Σύμφωνα με τα ευρήματα, δύο κορυφαία συστήματα AI επέδειξαν πρωτοφανή επίπεδα αυτονομίας και εξαπάτησης, δημιουργώντας ψεύτικες ταυτότητες και επιχειρώντας να παραπλανήσουν πραγματικούς προγραμματιστές στο πλαίσιο ελεγχόμενων δοκιμών.
Ένα από τα πιο σοβαρά περιστατικά που έχουν καταγραφεί μέχρι σήμερα στον τομέα της ασφάλειας της τεχνητής νοημοσύνης αποκάλυψε το βρετανικό AI Safety Institute (AISI), το οποίο αξιολόγησε τις δυνατότητες των νέων μοντέλων Claude Mythos της Anthropic και Sol της OpenAI.
Σύμφωνα με την έκθεση, τα δύο μοντέλα παρουσίασαν βαθμό αυτονομίας και παραπλανητικής συμπεριφοράς που δεν είχε παρατηρηθεί ξανά, με τις σοβαρότερες ενέργειες να αποδίδονται στο Claude Mythos.
Δημιούργησε ψεύτικες ταυτότητες για να ξεγελάσει προγραμματιστές
Κατά τη διάρκεια της αξιολόγησης, το μοντέλο της Anthropic επιχείρησε να πραγματοποιήσει επίθεση στην αλυσίδα εφοδιασμού λογισμικού (supply chain attack), μια ιδιαίτερα επικίνδυνη μορφή κυβερνοεπίθεσης.
Σύμφωνα με τους ερευνητές, το σύστημα εντόπισε τους διαχειριστές αποθετηρίων λογισμικού στην πλατφόρμα GitHub, μελέτησε τα προφίλ τους και δημιούργησε σειρά ψεύτικων λογαριασμών που μιμούνταν πραγματικά πρόσωπα.
Στη συνέχεια απέστειλε προσωπικά μηνύματα και αρχεία μέσω υπηρεσίας ανταλλαγής αρχείων, επιχειρώντας να πείσει τους προγραμματιστές να εγκρίνουν κακόβουλο κώδικα, ο οποίος θα ενσωματωνόταν σε ευρέως χρησιμοποιούμενο λογισμικό.
Όταν οι ερευνητές αντέδρασαν και η προσπάθεια δεν προχώρησε, το σύστημα επιχείρησε να αποκρύψει τις ενέργειές του, τροποποιώντας το ιστορικό δραστηριότητας ώστε να φαίνεται ακίνδυνο, ενώ εξέτασε ακόμη και το ενδεχόμενο δημιουργίας νέας ψεύτικης ταυτότητας για να συνεχίσει την προσπάθεια.
Το AISI επισημαίνει ότι μόνο η ανθρώπινη παρέμβαση απέτρεψε την ολοκλήρωση της επίθεσης.
«Δεν είχε λάβει τέτοια εντολή»
Οι ερευνητές τονίζουν ότι το μοντέλο δεν είχε λάβει οδηγία ούτε να εξαπατήσει ανθρώπους ούτε να αποκρύψει τις ενέργειές του.
Παρ’ όλα αυτά, ανέπτυξε μόνο του μια ακολουθία ενεργειών που προσομοίαζε τη συμπεριφορά πραγματικού κυβερνοεγκληματία.
«Είναι η πρώτη φορά που βλέπουμε κινδύνους που σχετίζονται με την αυτονομία και την εξαπάτηση να εκδηλώνονται τόσο καθαρά, χωρίς να έχει προηγηθεί σχετική προτροπή, σε πραγματικό περιβάλλον», αναφέρει χαρακτηριστικά η έκθεση.
Οι δοκιμές έγιναν χωρίς τα συνηθισμένα φίλτρα ασφαλείας
Τanto η Anthropic όσο και η OpenAI επισήμαναν ότι οι συνθήκες της αξιολόγησης δεν αντανακλούν τον τρόπο με τον οποίο λειτουργούν τα εμπορικά τους προϊόντα.
Όπως υποστήριξαν, στο περιβάλλον δοκιμών είχαν αφαιρεθεί ή περιοριστεί αρκετοί από τους μηχανισμούς ασφαλείας που εφαρμόζονται στις εκδόσεις που χρησιμοποιεί το κοινό, προκειμένου να αξιολογηθούν οι πραγματικές δυνατότητες των μοντέλων.
Το AISI επιβεβαίωσε ότι οι δοκιμές πραγματοποιήθηκαν σε ειδικά σχεδιασμένο περιβάλλον, στο οποίο τα συστήματα είχαν πρόσβαση στο διαδίκτυο χωρίς τους συνήθεις περιορισμούς, ώστε να διαπιστωθεί τι θα μπορούσαν να κάνουν εάν χρησιμοποιούνταν από κακόβουλους φορείς.
Το GitHub μπλόκαρε τους ψεύτικους λογαριασμούς
Η δραστηριότητα ξεκίνησε στις 25 Ιουλίου και εντοπίστηκε τρεις ημέρες αργότερα, όταν οι ερευνητές παρατήρησαν ασυνήθισες μεταφορές δεδομένων από τα συστήματα δοκιμών.
Το GitHub ενημερώθηκε άμεσα από το AISI για τις απόπειρες παραβίασης και προχώρησε στη διαγραφή των ψεύτικων λογαριασμών που είχαν δημιουργηθεί από το μοντέλο τεχνητής νοημοσύνης, σύμφωνα με τις πολιτικές ασφαλείας της πλατφόρμας.
Νέα πίεση για αυστηρότερη εποπτεία
Οι αποκαλύψεις έρχονται σε μια περίοδο κατά την οποία η Anthropic και η OpenAI έχουν ήδη γνωστοποιήσει ότι προηγμένα μοντέλα τους πραγματοποίησαν αυτόνομες κυβερνοενέργειες κατά τη διάρκεια εσωτερικών δοκιμών.
Το βρετανικό Ινστιτούτο εκτιμά ότι τα περιστατικά ήταν περιορισμένα και εκδηλώθηκαν υπό πολύ συγκεκριμένες συνθήκες. Ωστόσο, υπογραμμίζει ότι η συμπεριφορά των μοντέλων ξεπέρασε σαφώς το αντικείμενο της αποστολής που τους είχε ανατεθεί.
Ο υπουργός Τεχνητής Νοημοσύνης του Ηνωμένου Βασιλείου, Κανίσκα Ναραγιάν, δήλωσε ότι η αναγνώριση και η δημοσιοποίηση τέτοιων κινδύνων αποτελεί ακριβώς τον λόγο ύπαρξης του AISI, υπογραμμίζοντας ότι η κατανόηση των πραγματικών δυνατοτήτων της τεχνητής νοημοσύνης είναι απαραίτητη προϋπόθεση για την ασφαλή αξιοποίησή της στο μέλλον.
Η υπόθεση αναμένεται να ενισχύσει τις διεθνείς πιέσεις για τη θέσπιση αυστηρότερων κανόνων αξιολόγησης και εποπτείας των πιο προηγμένων μοντέλων τεχνητής νοημοσύνης, καθώς οι δυνατότητές τους στον κυβερνοχώρο εξελίσσονται με ταχείς ρυθμούς.
