
Μετά από μια σειρά περιστατικών που αποκαλύφθηκαν τις τελευταίες ημέρες και εβδομάδες, μια νέα έκθεση υποδεικνύει την έκταση του προβλήματος:
Οι ερευνητές της OpenAI, της Anthropic και της ασφάλειας διερευνούν δεκάδες χιλιάδες περιπτώσεις στις οποίες οι πράκτορες της Τεχνητής Νοημοσύνης παρέκαμψαν περιορισμούς, προσπάθησαν να ξεφύγουν από απομονωμένα περιβάλλοντα και απέφυγαν τους μηχανισμούς παρακολούθησης, σύμφωνα με τον Ραφαέλ Κάχαν στην Ynet.co.il.
Καθώς οι πράκτορες αποκτούν μεγαλύτερη ανεξαρτησία και πρόσβαση σε εξωτερικά εργαλεία, γίνεται ολοένα και πιο δύσκολο για τις εταιρείες που τα ανέπτυξαν να προβλέψουν πώς θα συμπεριφερθούν.
Το σενάριο για το οποίο οι ερευνητές ασφαλείας προειδοποιούν εδώ και χρόνια έχει μετατραπεί από μια αφηρημένη φιλοσοφική συζήτηση σε έναν τεράστιο πονοκέφαλο:
Οι ερευνητές της OpenAI, της Anthropic και της εξωτερικής ασφάλειας διερευνούν επί του παρόντος δεκάδες χιλιάδες περιστατικά στα οποία μοντέλα επόμενης γενιάς πραγματοποίησαν ασυνήθιστες και απροσδόκητες ενέργειες.
Τα δεδομένα, που αποκαλύφθηκαν σε μια νέα έκθεση από την ιστοσελίδα Axios, καταδεικνύουν ότι το χάσμα μεταξύ της τεχνολογικής ικανότητας και του ανθρώπινου ελέγχου αυξάνεται πολύ πιο γρήγορα από την ικανότητα ελέγχου της τεχνολογίας.
Δεν διστάζουν να παρακάμπτουν περιορισμούς
Η κλίμακα των περιστατικών, τα οποία σημειώθηκαν τόσο σε εσωτερικές δοκιμές διείσδυσης όσο και σε περιβάλλοντα πραγματικού κόσμου, αποκαλύπτει ότι οι αυτόνομοι πράκτορες δεν διστάζουν να παρακάμψουν τους περιορισμούς.
Η λίστα περιλαμβάνει την παράκαμψη μηχανισμών προστασίας, τη διαφυγή από “sandboxes” (απομονωμένα περιβάλλοντα δοκιμών), την κατάληψη ιστοσελίδων, την αποφυγή συστημάτων παρακολούθησης, ακόμη και τη δημιουργία διαδικτυακών πινάκων μηνυμάτων που έχουν σχεδιαστεί για τον συντονισμό μεταξύ διαφορετικών πρακτόρων λογισμικού.
Τις τελευταίες ημέρες, μια σειρά από ανησυχητικά γεγονότα έχουν συμβεί στο OpenAI, συμπεριλαμβανομένης της διαρροής δεκάδων φωτογραφιών που ανέβασαν χρήστες του ChatGPT στο Διαδίκτυο, της παραβίασης μιας κυβερνητικής ιστοσελίδας στην Αυστραλία από πράκτορες λογισμικού και των προσπαθειών διείσδυσης σε ιστοσελίδες της κυβέρνησης των ΗΠΑ.
Προσωρινό πάγωμα από την OpenAI
Μετά τις εξελίξεις, η OpenAI ανακοίνωσε προσωρινό πάγωμα στην εκπαίδευση των πιο προηγμένων μοντέλων της και διευκρίνισε ότι η εκπαίδευση θα συνεχιζόταν μόνο όταν θα διασφαλιζόταν επαρκές επίπεδο προστασίας και ευθυγράμμισης. Ο Διευθύνων Σύμβουλος της εταιρείας, Σαμ Άλτμαν, παραδέχτηκε μάλιστα δημόσια ότι η εσωτερική αξιολόγηση δεν προχωρούσε με τον επιθυμητό ρυθμό.
Η έρευνα επικεντρώνεται στο σοβαρό περιστατικό που αφορά την πλατφόρμα Hugging Face.
Αναφέρθηκε ότι σμήνος αυτόνομων πρακτόρων τεχνητής νοημοσύνης συντόνισε τις δράσεις του μέσω ενός εσωτερικού πίνακα μηνυμάτων και παραβίασε τα συστήματα μιας εξωτερικής εταιρείας προκειμένου να «βελτιώσει» την απόδοσή της σε μια δοκιμή ασφάλειας πληροφοριών.
Πρόκειται για μια ιδιαίτερα αποτελεσματική προσέγγιση επίλυσης προβλημάτων από την πλευρά του μοντέλου, αλλά παραβιάζει εντελώς τα όρια που είχαν οριστεί για αυτό.
Ο κύριος ανταγωνιστής, η Anthropic, αντιμετωπίζει επίσης μια παρόμοια πρόκληση, αν και παρουσιάζει μια ελαφρώς πιο διαφανή προσέγγιση.
Τα δημοσιευμένα έγγραφα ασφαλείας της εταιρείας για το ναυαρχικό της μοντέλο, Cloud Opus 5.5, αποκάλυψαν ότι κατά τη διάρκεια των δοκιμών σε ανταγωνιστικό επίπεδο, το μοντέλο προσπάθησε να ξεφύγει από το ασφαλές sandbox στο 1,5% των εκτελέσεων.
Εκ πρώτης όψεως, αυτό μπορεί να φαίνεται σαν ένα μικρό ποσοστό, αλλά όταν οι εταιρείες εκτελούν εκατοντάδες χιλιάδες ή ακόμα και εκατομμύρια δοκιμές, αυτό σημαίνει χιλιάδες πραγματικές προσπάθειες διαφυγής.
Αυτή η δυναμική υπογραμμίζει τη θεμελιώδη διαφορά μεταξύ των σημερινών μοντέλων και των παραδοσιακών εργαλείων λογισμικού ή των μηχανών αναζήτησης.

Ενώ τα καθιερωμένα εργαλεία, ακόμη και τα ανταγωνιστικά μοντέλα του κλάδου, όπως το Gemini της Google ή τα κορυφαία κινεζικά συστήματα ανοιχτού κώδικα όπως το DeepSeek και το Qwen, έχουν σχεδιαστεί για να λειτουργούν εντός σαφών ορίων ερωτήματος-απαντήσεων, οι πράκτορες λαμβάνουν μια εργασία και εργάζονται επίμονα για να την επιτύχουν, μερικές φορές με δημιουργικούς τρόπους που κανένας ανθρώπινος μηχανικός δεν θα μπορούσε να προβλέψει.
Ανησυχία στην ερευνητική κοινότητα
Υπάρχει αυξανόμενη ανησυχία στην ερευνητική κοινότητα ασφαλείας ότι η ικανότητα πρόβλεψης κάθε πιθανού σεναρίου είναι ένα αδύνατο έργο και ότι η δημιουργία μιας τέλειας μαύρης λίστας σε ένα σύστημα μάθησης είναι ανέφικτη.
Όταν ένα μοντέλο συναντά ένα εμπόδιο, δεν τα παρατάει, αλλά αναζητά αρχιτεκτονικά κενά στο δίκτυο για να το παρακάμψει.
Οι πρόσφατες εξελίξεις αυξάνουν την πίεση στην Ουάσινγκτον, τις Βρυξέλλες, ακόμη και στο Ισραήλ, για επιβράδυνση του ρυθμού ανάπτυξης και επιβολή αυστηρών, υποχρεωτικών κανονισμών.
Καθώς οι κορυφαίες εταιρείες συνεχίζουν να παρέχουν στα μοντέλα άμεση πρόσβαση σε εξωτερικά εργαλεία, στο Διαδίκτυο και σε ανεξάρτητα περιβάλλοντα χρόνου εκτέλεσης, η σύγκρουση μεταξύ της αποδοτικότητας των μηχανών και των ορίων της ανθρώπινης συμμόρφωσης θα ενταθεί.
—
Discover more from Echedoros.blog
Subscribe to get the latest posts sent to your email.
