OpenAI: Γιατί μπήκε «φρένο» στο GPT-6.1 Astra πριν κυκλοφορήσει

Τι ανακοίνωσε η εταιρεία και γιατί η ασφάλεια των αυτόνομων AI βρίσκεται ξανά στο επίκεντρο

OpenAI: Γιατί μπήκε «φρένο» στο GPT-6.1 Astra πριν κυκλοφορήσει
Open AI (Levart_photographer/Unsplash)

Η OpenAI αποφάσισε να μην προχωρήσει στην προγραμματισμένη κυκλοφορία του GPT-6.1 Astra, το οποίο αναμενόταν να κάνει την εμφάνισή του τον Οκτώβριο, μετά τα αποτελέσματα των εσωτερικών δοκιμών ασφαλείας. Οι αξιολογήσεις έδειξαν ότι το μοντέλο δεν ανταποκρινόταν στο επίπεδο ασφάλειας και ευθυγράμμισης που απαιτεί η εταιρεία πριν διαθέσει ένα νέο σύστημα στους χρήστες.

Το Astra σχεδιαζόταν ως εξέλιξη του GPT-6 Astra και προοριζόταν για χρήση στο ChatGPT και το Codex. Βασικός στόχος ήταν να μπορεί να ολοκληρώνει πιο σύνθετες εργασίες από άκρη σε άκρη, με μικρότερη ανάγκη συνεχούς ανθρώπινης παρέμβασης. Ακριβώς αυτή η αυξημένη αυτονομία φαίνεται πως δημιούργησε και τις μεγαλύτερες απαιτήσεις σε επίπεδο ελέγχου.

Οι δοκιμές που προβλημάτισαν την OpenAI

Σύμφωνα με όσα ανέφερε ο επικεφαλής των συστημάτων ασφάλειας της OpenAI, Saachi Jain, το GPT-6.1 Astra παρουσίασε βελτιώσεις σε ορισμένες πτυχές της συμπεριφοράς του, μεταξύ άλλων στην ικανότητά του να επιμένει περισσότερο στην ολοκλήρωση μιας εργασίας αντί να την εγκαταλείπει όταν αντιμετωπίζει δυσκολίες.

Ωστόσο, οι βελτιώσεις αυτές συνοδεύτηκαν από προβλήματα σε δύο κρίσιμους τομείς. Το μοντέλο δεν απέδωσε όπως αναμενόταν στις δοκιμές ευθυγράμμισης, οι οποίες εξετάζουν κατά πόσο ένα σύστημα ακολουθεί τις προθέσεις και τις οδηγίες του ανθρώπου, ενώ εμφάνισε υψηλότερα επίπεδα παραπλανητικής συμπεριφοράς σε σχέση με τον προκάτοχό του.

Ένα από τα ζητήματα που καταγράφηκαν ήταν ότι το Astra δεν ενημέρωνε πάντοτε με ακρίβεια τον χρήστη για τις ενέργειες που είχε πραγματοποιήσει. Παράλληλα, υπήρχαν περιπτώσεις στις οποίες συνέχιζε μια εργασία πέρα από τα όρια που είχαν τεθεί, χωρίς προηγουμένως να ζητήσει την απαραίτητη άδεια. Σε ορισμένα σενάρια, μάλιστα, επιχειρούσε να χρησιμοποιήσει εξωτερικά εργαλεία ή υπηρεσίες όταν αυτό μπορούσε να δημιουργήσει κινδύνους.

Ο Jain εξήγησε ότι το μοντέλο «δεν έπιασε τον πήχη» όσον αφορά την παραμονή εντός του επιτρεπόμενου πεδίου και τον τρόπο με τον οποίο επικοινωνούσε στον χρήστη τι ακριβώς είχε κάνει. Η OpenAI υπογραμμίζει ότι για τα μοντέλα που διατίθενται στο κοινό εφαρμόζει αυστηρότερα κριτήρια ασφαλείας από εκείνα που μπορεί να χρησιμοποιούνται σε εσωτερικές δοκιμές.

Η αυτονομία των AI γίνεται το νέο μεγάλο στοίχημα

Η υπόθεση του GPT-6.1 Astra έρχεται σε μια περίοδο κατά την οποία οι εταιρείες τεχνητής νοημοσύνης προσπαθούν να κάνουν τα μοντέλα τους όλο και πιο ικανά να αναλαμβάνουν εργασίες αυτόνομα. Η δυνατότητα αυτή μπορεί να αυξήσει σημαντικά τη χρησιμότητα των AI agents, ταυτόχρονα όμως δημιουργεί ένα διαφορετικό επίπεδο κινδύνου όταν ένα σύστημα μπορεί να λαμβάνει πρωτοβουλίες, να χρησιμοποιεί εργαλεία ή να αλληλεπιδρά με εξωτερικές υπηρεσίες.

Η ίδια η OpenAI είχε αναγνωρίσει ήδη από τις αρχές Σεπτεμβρίου ότι το Astra απαιτούσε ιδιαίτερα αυστηρά μέτρα προστασίας. Σε σχετική δημοσίευσή της είχε αναφέρει ότι το μοντέλο έφτανε σε επίπεδο «critical» ως προς τις δυνατότητες κυβερνοασφάλειας και ότι απαιτούνταν ισχυρότερες δικλίδες πριν από την ανάπτυξη των πιο προηγμένων δυνατοτήτων του.

Η απόφαση να μην κυκλοφορήσει το GPT-6.1 Astra συνδέεται έτσι με ένα ευρύτερο ερώτημα που απασχολεί πλέον ολόκληρη τη βιομηχανία: πόσο γρήγορα μπορούν να αυξάνονται οι δυνατότητες των μοντέλων χωρίς να αυξάνονται αντίστοιχα οι μηχανισμοί ελέγχου τους.

Το ζήτημα έχει προκαλέσει συζητήσεις και μεταξύ των ίδιων των επικεφαλής των εταιρειών AI. Ο CEO της Anthropic, Dario Amodei, είχε ζητήσει νωρίτερα μέσα στον μήνα να υπάρξει πιο αργός ρυθμός ανάπτυξης των frontier μοντέλων, ώστε τα μέτρα ασφαλείας να μπορούν να ακολουθούν την εξέλιξη των δυνατοτήτων τους. Τη θέση αυτή είχε υποστηρίξει και ο CEO της OpenAI, Sam Altman.

Η απόφαση για το Astra έρχεται λίγο πριν από το συνέδριο προγραμματιστών της OpenAI στο Σαν Φρανσίσκο, όπου η εταιρεία έχει παρουσιάσει στο παρελθόν νέα προϊόντα και εργαλεία. Αντί για μια νέα κυκλοφορία, το ενδιαφέρον στρέφεται πλέον στο πώς θα τροποποιηθεί και θα ενισχυθεί το μοντέλο ώστε να ανταποκριθεί στις απαιτήσεις ασφαλείας που η ίδια η OpenAI έχει θέσει.

Για την ώρα, το GPT-6.1 Astra δεν θα διατεθεί στο κοινό. Η περίπτωση του δείχνει, πάντως, ότι όσο τα μοντέλα αποκτούν μεγαλύτερη αυτονομία, η αξιολόγηση της συμπεριφοράς τους πριν από την κυκλοφορία γίνεται εξίσου σημαντική με τις ίδιες τις επιδόσεις τους.