|
Τι
είναι το AI jailbreak
Στην τεχνητή νοημοσύνη,
το jailbreak
αφορά την προσπάθεια να
παρακαμφθούν οι
ενσωματωμένοι
περιορισμοί ενός
μοντέλου, ώστε αυτό να
παράσχει απαντήσεις ή να
εκτελέσει ενέργειες που
υπό κανονικές συνθήκες
θα αρνιόταν.
Οι ερευνητές
χρησιμοποιούν σύνθετα
prompts
και διαφορετικές
τεχνικές χειραγώγησης
της συνομιλίας, με στόχο
να διαπιστώσουν εάν το
σύστημα μπορεί να
«ξεφύγει» από τους
κανόνες ασφαλείας που
έχουν θέσει οι
προγραμματιστές του.
Ο όρος προέρχεται από
την πληροφορική και
χρησιμοποιήθηκε αρχικά
για την παράκαμψη
περιορισμών σε συσκευές
και λογισμικό. Στον χώρο
της AI
έχει αποκτήσει
διαφορετική διάσταση,
καθώς συνδέεται με την
ικανότητα ενός μοντέλου
να αγνοεί τους κανόνες
που έχουν σχεδιαστεί για
να περιορίζουν
επικίνδυνες απαντήσεις.
«Ανησυχητικά» τα
αποτελέσματα
Ο ιδρυτής της
Mindgard,
Πίτερ Γκάραχαν,
δήλωσε στο BBC
ότι τα αποτελέσματα των
δοκιμών στα δύο μοντέλα
Kimi
είναι ανησυχητικά.
Σύμφωνα με τον ίδιο,
όταν ένας περιορισμός
ασφαλείας παρακαμφθεί,
ένα μοντέλο μπορεί να
αρχίσει να συζητά θέματα
που κανονικά θα απέφευγε
και να παρέχει ακόμη και
προτάσεις σχετικά με
επικίνδυνες
δραστηριότητες.
Η Mindgard,
πάντως, διευκρινίζει ότι
η έρευνά της δεν
αποδεικνύει πως οι
πληροφορίες που παρείχαν
τα μοντέλα μπορούν
πράγματι να μετατραπούν
σε αποτελεσματική
επίθεση στην
πραγματικότητα.
Το ζήτημα αφορά κυρίως
το γεγονός ότι οι
μηχανισμοί ασφαλείας δεν
εμπόδισαν εξαρχής τα
μοντέλα να ανταποκριθούν
σε τέτοια αιτήματα.
Από το chatbot
στις κυβερνοεπιθέσεις
Ιδιαίτερο ενδιαφέρον
παρουσιάζει το
ενδεχόμενο ένα μοντέλο
χωρίς επαρκείς
περιορισμούς να
χρησιμοποιηθεί ως
εργαλείο για
κυβερνοεπιθέσεις.
Η Mindgard
υποστηρίζει ότι μία
έκδοση του
Kimi
K2.6
χωρίς τα κατάλληλα
συστήματα ασφαλείας θα
μπορούσε θεωρητικά να
επιτρέψει σε
επιτιθέμενους να
εκτελούν κώδικα στους
υπολογιστικούς πόρους
όπου λειτουργεί το
μοντέλο και να αποκτούν
πρόσβαση στο διαδίκτυο.
Σε ένα τέτοιο σενάριο,
το AI
δεν θα αποτελούσε απλώς
ένα εργαλείο παραγωγής
κειμένου, αλλά θα
μπορούσε να λειτουργήσει
ως σημείο εκκίνησης για
πιο σύνθετες κακόβουλες
ενέργειες.
Η Mindgard
ενημέρωσε τη
Moonshot
για τα ευρήματά της στις
27 Ιουλίου,
ενώ δημοσίευσε τη
σχετική έκθεση στις
12 Σεπτεμβρίου.
Σύμφωνα με την εταιρεία,
η επικοινωνία με τη
Moonshot
έγινε μόλις πρόσφατα,
μετά την επικοινωνία του
BBC
για το θέμα.
Από την πλευρά της, η
Moonshot
ανέφερε ότι καλωσορίζει
τις αξιολογήσεις από
ανεξάρτητους φορείς και
χαρακτήρισε τις
εξωτερικές δοκιμές
«βασικό πυλώνα» για τη
δημιουργία ασφαλέστερων
συστημάτων AI.
Η εταιρεία υποστήριξε
επίσης ότι τα μοντέλα
της εμφανίζουν γενικά
υψηλό ποσοστό
άρνησης σε
αντίστοιχα αιτήματα κατά
τις εσωτερικές δοκιμές
ασφαλείας.
Διαφορετικός κίνδυνος
από τους αυτόνομους
AI
agents
Το περιστατικό
αναδεικνύει έναν κίνδυνο
που διαφέρει από εκείνον
των ολοένα πιο αυτόνομων
AI
agents.
Οι agents
σχεδιάζονται ώστε να
μπορούν να εκτελούν
αλληλουχίες ενεργειών με
περιορισμένη ανθρώπινη
παρέμβαση. Τους
τελευταίους μήνες έχουν
καταγραφεί ελεγχόμενες
δοκιμές στις οποίες
agents
που αναπτύχθηκαν από
αμερικανικές εταιρείες
όπως οι
OpenAI,
Meta
και Anthropic
κατάφεραν να παραβιάσουν
διαδικτυακές υπηρεσίες.
Στην περίπτωση του
jailbreaking,
το βασικό πρόβλημα είναι
διαφορετικό: ένα μοντέλο
που υποτίθεται ότι
διαθέτει συγκεκριμένα
όρια ασφαλείας μπορεί,
μέσω κατάλληλων οδηγιών,
να πειστεί να τα
παρακάμψει.
Το «ανοικτό» μοντέλο και
το δίλημμα της ασφάλειας
Η υπόθεση επαναφέρει στο
προσκήνιο και τη
συζήτηση για την
ασφάλεια των
open-weight
μοντέλων.
Το Kimi
ανήκει στην κατηγορία
των μοντέλων των οποίων
τα βάρη είναι διαθέσιμα,
επιτρέποντας σε τρίτους
να τα εγκαταστήσουν και
να τα λειτουργήσουν στις
δικές τους υποδομές.
Αυτό δημιουργεί ένα
σημαντικό δίλημμα. Από
τη μία πλευρά, η
μεγαλύτερη πρόσβαση στα
μοντέλα επιτρέπει σε
ερευνητές και
επιχειρήσεις να τα
μελετούν, να τα
προσαρμόζουν και να
αναπτύσσουν εφαρμογές
χωρίς να εξαρτώνται
αποκλειστικά από τον
αρχικό πάροχο.
Από την άλλη, όσο
περισσότερο διαδίδονται
τα μοντέλα, τόσο
δυσκολότερο γίνεται να
ελεγχθεί ο τρόπος με τον
οποίο χρησιμοποιούνται
και τα επίπεδα ασφαλείας
που εφαρμόζονται σε κάθε
εγκατάσταση.
Ο καθηγητής Άλαν
Γούντγουορντ
από το Πανεπιστήμιο του
Σάρεϊ έχει επισημάνει
ότι τα ανοικτά μοντέλα
μπορεί να βρεθούν σε
λάθος χέρια, αλλά
ταυτόχρονα μπορούν να
αξιοποιηθούν και για την
ενίσχυση της
κυβερνοάμυνας.
Το πρόβλημα γίνεται
ακόμη πιο σύνθετο από
την ταχύτητα με την
οποία εξελίσσεται η
τεχνολογία. Οι διεθνείς
κανόνες και τα τεχνικά
πρότυπα χρειάζονται
συχνά χρόνια για να
συμφωνηθούν και να
εφαρμοστούν, ενώ οι
δυνατότητες των μοντέλων
AI
αλλάζουν μέσα σε λίγους
μήνες.
Το μεγάλο στοίχημα
Η υπόθεση των
Kimi
αναδεικνύει έτσι ένα
ευρύτερο ζήτημα για
ολόκληρη τη βιομηχανία
AI:
η ασφάλεια δεν
κρίνεται μόνο από το τι
μπορεί ή δεν μπορεί να
κάνει ένα μοντέλο, αλλά
και από το πόσο δύσκολο
είναι να παρακαμφθούν οι
δικλίδες ασφαλείας του.
Για τη Mindgard
και άλλους ειδικούς, η
αντιμετώπιση του
προβλήματος δεν μπορεί
να περιοριστεί
αποκλειστικά στην
προσθήκη περισσότερων
φίλτρων. Εξίσου
σημαντικός είναι ο
εντοπισμός όσων
επιχειρούν να
χρησιμοποιήσουν την
τεχνητή νοημοσύνη για
κακόβουλους σκοπούς.
Καθώς τα μοντέλα
αποκτούν μεγαλύτερες
δυνατότητες και
περισσότερη πρόσβαση σε
δεδομένα, υπολογιστικούς
πόρους και διαδικτυακές
υπηρεσίες, η
ανθεκτικότητα απέναντι
σε jailbreaks
μετατρέπεται σε κρίσιμο
παράγοντα για την
ασφάλεια της επόμενης
γενιάς συστημάτων
τεχνητής νοημοσύνης.
|