ΣΧΕΤΙΚΑ ΑΡΘΡΑ
OpenAI: Νέο περιστατικό με AI agents – «Σάρωσαν» 16.000 φορές ιστοσελίδα του ΟΗΕ και παρέκαμψαν φίλτρο ασφαλείας
Η OpenAI αποφάσισε να αναβάλει την κυκλοφορία του νέου μοντέλου τεχνητής νοημοσύνης GPT-6.1 Astra, έπειτα από προβλήματα ασφάλειας και ευθυγράμμισης που εντοπίστηκαν σε εσωτερικές δοκιμές.
Η απόφαση αποτελεί σπάνια περίπτωση όπου μεγάλη εταιρεία τεχνητής νοημοσύνης αποσύρει νέα έκδοση πριν από τη διάθεσή της, καθώς οι ερευνητές της έκριναν ότι δεν πληρούσε τα απαιτούμενα κριτήρια. Το μοντέλο, που προοριζόταν να ενσωματωθεί στο ChatGPT και το Codex, είχε προγραμματιστεί να παρουσιαστεί τον Οκτώβριο.
Σύμφωνα με τη Wall Street Journal, ήταν πιο ικανό από τις προηγούμενες εκδόσεις στην ολοκλήρωση σύνθετων εργασιών από την αρχή έως το τέλος, χωρίς ανθρώπινη παρέμβαση, αλλά παρουσίασε υποχώρηση σε δύο κρίσιμους τομείς ασφάλειας.
Παραπλάνηση
Η Σάτσι Τζέιν, επικεφαλής των συστημάτων ασφάλειας της OpenAI, δήλωσε στη Wall Street Journal ότι το GPT-6.1 Astra εμφάνισε μεγαλύτερη τάση παραπλάνησης σε σχέση με τον προκάτοχό του, GPT-6 Astra. Συγκεκριμένα, δεν ενημέρωνε πάντα με ειλικρίνεια τους χρήστες για τις ενέργειες που είχε ή δεν είχε πραγματοποιήσει.
Παράλληλα, σε ορισμένες περιπτώσεις προχωρούσε σε εργασίες χωρίς να ζητήσει την έγκριση του χρήστη και επιχειρούσε να χρησιμοποιήσει εξωτερικά εργαλεία ή υπηρεσίες, ακόμη και όταν αυτό ενδεχομένως δεν ήταν ασφαλές. Η OpenAI περιγράφει το ζήτημα ως «εξουσιοδότηση πεδίου», δηλαδή την ανάγκη τα μοντέλα να παραμένουν εντός των ορίων που έχει θέσει ο χρήστης.
Το GPT-6.1 Astra είχε βελτιωθεί σε άλλους τομείς, όπως η τάση των μοντέλων να εμφανίζουν «τεμπελιά» στην εκτέλεση εργασιών. Ωστόσο, η εταιρεία έκρινε ότι οι αδυναμίες του στην ασφάλεια και την ευθυγράμμιση δεν επέτρεπαν τη δημόσια διάθεσή του.
Η απόφαση έρχεται μετά από σειρά περιστατικών κατά τη διάρκεια του καλοκαιριού, στα οποία συστήματα τεχνητής νοημοσύνης φέρονται να υπερέβησαν τα όρια των δοκιμών τους. Εσωτερικοί agents της OpenAI, που συμμετείχαν σε άσκηση κυβερνοασφάλειας, κατάφεραν να αποκτήσουν πρόσβαση στην πλατφόρμα Hugging Face. Αντίστοιχες, λιγότερο εκτεταμένες κινήσεις καταγράφηκαν σε ιστοτόπους της αυστραλιανής κυβέρνησης και του ΟΗΕ.
Την περασμένη εβδομάδα η OpenAI ανακοίνωσε ότι διέκοψε προσωρινά την εκπαίδευση των ισχυρότερων μοντέλων της, αφού ένας agent παρέκαμψε περιορισμούς πρόσβασης στο διαδίκτυο για να υποβάλει ερώτημα σε δημόσιο chatbot. Η εταιρεία διευκρίνισε ότι το GPT-6.1 Astra δεν ήταν ένα από τα μοντέλα των οποίων η εκπαίδευση έχει ανασταλεί, αλλά διαφορετική περίπτωση.
Η OpenAI έχει δημιουργήσει νέο σύστημα παρακολούθησης για τον ταχύτερο εντοπισμό προβληματικής συμπεριφοράς των agents και έχει απαιτήσει αυστηρότερες δικλίδες ασφαλείας στις εσωτερικές δοκιμές. Σχεδιάζει, επίσης, να διερευνήσει τα αίτια των αστοχιών του GPT-6.1 Astra, μεταξύ άλλων αν οι διαδικασίες ενισχυτικής μάθησης επιβραβεύουν τις κατάλληλες συμπεριφορές.
Η εταιρεία δεν αποκλείει να χρησιμοποιήσει τη βασική έκδοση του μοντέλου για νέους κύκλους εκπαίδευσης, με στόχο μελλοντικές εκδόσεις της σειράς GPT-6. Η απόφαση λαμβάνεται ενώ εντείνεται η πολιτική και ρυθμιστική πίεση προς τις εταιρείες τεχνητής νοημοσύνης, με την OpenAI να βρίσκεται αντιμέτωπη και με αγωγή του γενικού εισαγγελέα της Φλόριντα, ο οποίος ζητεί αυστηρότερες εγγυήσεις ασφαλείας.
Διαβάστε επίσης:
Γένοβα: Αρχίζει την Πέμπτη η έκθεση με 1.000 mega yachts
Creta Farms: Ανάπτυξη πωλήσεων το 2025 – Αύξηση 6,3% των EBITDA, στα 7,45 εκατ. ευρώ
ΕΙΔΗΣΕΙΣ ΣΗΜΕΡΑ
- ΟΛΠ: Στα €35,4 εκατ. τα έσοδα το ‘ εξάμηνο – Αύξηση 8,3% στο ενεργητικό
- Χρηματιστήριο: Πάει να βγάλει αντίδραση η Allwyn, focus στην AVAX λόγω Alpha Finance
- Κασσελάκης: Πήγε στο «Cash or Trash» με τα ασημικά της μητέρας του – «Είμαι σκληρός διαπραγματευτής» (βίντεο)
- Πειραιάς: 2 τηλεφωνήματα για βόμβα στα δικαστήρια – Εκκενώθηκε το κτήριο
Μοιραστείτε την άποψή σας
ΣχόλιαΓια να σχολιάσετε χρησιμοποιήστε ένα ψευδώνυμο. Παρακαλούμε σχολιάζετε με σεβασμό. Χρησιμοποιείτε κατανοητή γλώσσα και αποφύγετε διατυπώσεις που θα μπορούσαν να παρερμηνευτούν ή να θεωρηθούν προσβλητικές. Με την ανάρτηση σχολίου, συμφωνείτε να τηρείτε τους Όρους του ιστότοπου contact Δημιουργήστε το account σας εδώ, για να κάνετε like, dislike ή report ακατάλληλα/προσβλητικά σχόλια.