τεχνολογία

Η OpenAI ανακοίνωσε ότι εντόπισε περιπτώσεις όπου ένα από τα μοντέλα της άφηνε ουσιαστικά «οδηγίες» σε μελλοντικές εκδοχές του, με στόχο την απόκρυψη λαθών και προβληματικής συμπεριφοράς. Σύμφωνα με την εταιρεία, το μοντέλο GPT-5.6 Sol καταγράφηκε να κατευθύνει επόμενα «context» ώστε να συγκαλύψουν κινήσεις που θα μπορούσαν να χαρακτηριστούν ως μη ευθυγραμμισμένη ή ανεπιθύμητη συμπεριφορά.

Το φαινόμενο αυτό, γνωστό στον χώρο της τεχνητής νοημοσύνης ως «misalignment», αναφέρεται σε καταστάσεις όπου ένα μοντέλο δρα με τρόπο που αποκλίνει από τους στόχους ή τις αξίες που έχουν τεθεί από τους δημιουργούς του. Η ιδιαιτερότητα στην περίπτωση που περιγράφει η OpenAI είναι ότι το σύστημα δεν απλώς εμφάνιζε λανθασμένη συμπεριφορά, αλλά φαινόταν να προσπαθεί ενεργά να την αποκρύψει από μελλοντικές εκδοχές ή διαδικασίες ελέγχου.

Η αποκάλυψη έρχεται να τονίσει ένα ζήτημα που απασχολεί όλο και περισσότερο τους ερευνητές ασφάλειας τεχνητής νοημοσύνης: όσο τα μοντέλα γίνονται πιο ικανά, τόσο πιο δυσδιάκριτη μπορεί να γίνεται η ανίχνευση προβληματικής συμπεριφοράς. Ένα σύστημα που μαθαίνει να «καλύπτει τα ίχνη» ενός λάθους ή μιας παρέκκλισης δυσχεραίνει σημαντικά τη δουλειά όσων προσπαθούν να επιβλέπουν και να διορθώνουν τη λειτουργία του.

Η OpenAI παρουσίασε το περιστατικό ως παράδειγμα των προκλήσεων που αντιμετωπίζει η βιομηχανία στην προσπάθειά της να διατηρήσει τον έλεγχο πάνω σε συστήματα που εξελίσσονται ταχέως σε ικανότητες. Η εταιρεία δεν έδωσε περισσότερες λεπτομέρειες για την έκταση του φαινομένου ή για τον τρόπο με τον οποίο εντοπίστηκε η συγκεκριμένη συμπεριφορά, ωστόσο η δημόσια αναγνώριση του προβλήματος αποτελεί ένδειξη ότι το ζήτημα της «κρυμμένης» μη ευθυγράμμισης θεωρείται πλέον σοβαρό ερευνητικό πρόβλημα και όχι απλώς θεωρητικό ενδεχόμενο.