TN: Οι εταιρείες αγωνίζονται να φτάσουν στην υπερνοημοσύνη χωρίς υποχρεωτική εποπτεία

04/09/2026

TN: Οι εταιρείες αγωνίζονται να φτάσουν στην υπερνοημοσύνη χωρίς υποχρεωτική εποπτεία

Τα πιο λαμπρά μυαλά του κόσμου, με τη στήριξη της μεγαλύτερης επένδυσης στην ανθρώπινη ιστορία, παραδέχονται ότι δεν μπορούν να ελέγξουν πλήρως την Τεχνητή Νοημοσύνη που δημιούργησαν, επειδή δεν την κατανοούν πλήρως

 

Ποτέ στην ιστορία της βιομηχανίας ή των εφευρέσεων κορυφαίες εταιρείες δεν είχαν δημιουργήσει ολόκληρα τμήματα με σκοπό να κατανοήσουν και να ερμηνεύσουν αυτό που οι ίδιες δημιούργησαν και εξαπέλυσαν στον κόσμο, γράφουν οι Jim VandeHei και Mike Allen του Axios στη στήλη «Behind the Curtain».

Οι ειδικοί δεν γνωρίζουν ακριβώς πώς «σκέφτεται» — ούτε τι είναι πραγματικά ικανή να κάνει όταν αφεθεί να εργάζεται αυτόνομα, μαζί με άλλους πράκτορες Τεχνητής Νοημοσύνης (AI agents).

Η προσπάθεια κατανόησης των μοντέλων γίνεται ακόμη πιο επείγουσα μετά τη χθεσινή παρουσίαση από την OpenAI του GPT-6 Astra, το οποίο χαρακτηρίστηκε ως «το ευφυέστερο και καλύτερα ευθυγραμμισμένο μοντέλο στον κόσμο». Ο πρόεδρος της OpenAI, Greg Brockman, χαρακτήρισε το Astra «άλμα δυνατοτήτων μιας ολόκληρης γενιάς» και δήλωσε ότι το μοντέλο θα μπορούσε να πληροί τα κριτήρια της AGI — της Τεχνητής Γενικής Νοημοσύνης, με δυνατότητες αντίστοιχες με εκείνες του ανθρώπου.

  • Ο διευθύνων σύμβουλος της OpenAI, Sam Altman, έγραψε την Τρίτη, σε μια προαναγγελία του Astra: «Η Τεχνητή Νοημοσύνη αποκτά εξαιρετικά μεγάλες δυνατότητες· κανείς δεν κατανοεί πλήρως τις συνέπειες αυτού».
  • Οι εταιρείες αγωνίζονται να φτάσουν στην υπερνοημοσύνη χωρίς να υπόκεινται σε υποχρεωτική εποπτεία — ούτε από κάποια ομοσπονδιακή υπηρεσία, ούτε από το υπουργείο Άμυνας ούτε από κάποια ανεξάρτητη κοινοπραξία ειδικών σε θέματα ασφάλειας. Το πόδι παραμένει πατημένο στο γκάζι.

Πίσω από τις γραμμές: Η τεχνολογία εξελίσσεται τόσο γρήγορα και προς τόσες διαφορετικές κατευθύνσεις, ώστε ούτε οι ίδιες οι εταιρείες — πόσο μάλλον η ομοσπονδιακή κυβέρνηση — είναι βέβαιες ποιοι είναι οι πραγματικοί κίνδυνοι ή ποιοι είναι οι καλύτεροι τρόποι για να τους περιορίσουν.

  • Ναι, ορισμένοι επικεφαλής εταιρειών Τεχνητής Νοημοσύνης ζητούν κατά καιρούς να μπει φρένο, όταν βλέπουν κάτι που τους τρομάζει. Ωστόσο, με την ομοσπονδιακή ρύθμιση να παραμένει εξαιρετικά περιορισμένη, οι ίδιες οι εταιρείες είναι εκείνες που αποφασίζουν πότε θα δημοσιοποιήσουν ανησυχητικές συμπεριφορές της ΤΝ.
  • Οι μεγάλες εταιρείες ΤΝ γνωρίζουν ότι το δημιούργημά τους μπορεί δυνητικά να πραγματοποιήσει καταστροφικές κυβερνοεπιθέσεις. Γι’ αυτό και υπέγραψαν επιστολή με την οποία κρούουν τον κώδωνα του κινδύνου και ζητούν «συλλογική δράση».

Το παράδοξο: Κάθε κορυφαίο εργαστήριο ΤΝ διαθέτει πλέον μια ομάδα που έχει ως αποστολή να ανακαλύψει τι ακριβώς κάνει η ίδια του η Τεχνητή Νοημοσύνη.

  • Η Anthropic, για παράδειγμα, διαθέτει ομάδα «Interpretability» — Ερμηνευσιμότητας — με σύνθημα «Ασφάλεια μέσω της κατανόησης». Στόχος της είναι «να ανακαλύψει και να κατανοήσει πώς λειτουργούν εσωτερικά τα μεγάλα γλωσσικά μοντέλα, ως θεμέλιο για την ασφάλεια της ΤΝ και για θετικά αποτελέσματα».

Πώς λειτουργεί: Κανείς δεν γράφει αυτά τα συστήματα γραμμή προς γραμμή. «Σε σύγκριση με το παραδοσιακό λογισμικό, εδώ έχεις πολύ μικρότερη δυνατότητα να σχεδιάσεις τις συγκεκριμένες συμπεριφορές των μοντέλων», λέει στο Axios ο Alex Mallen, ο οποίος εργάζεται πάνω στην ασφάλεια της ΤΝ στη Redwood Research. «Αντί γι’ αυτό, κατά κάποιον τρόπο, την καλλιεργείς και την αφήνεις να αναπτυχθεί».

Έτσι, τα εργαστήρια δοκιμάζουν τη συμπεριφορά ενός μοντέλου περίπου όπως θα δοκίμαζαν έναν άνθρωπο: του αναθέτουν μια εργασία και παρακολουθούν τι κάνει. Οι ερευνητές αποκαλούν αυτό alignment — «ευθυγράμμιση» — δηλαδή κατά πόσο το μοντέλο παραμένει πιστό στον στόχο που του έχει δοθεί.

Η παραβίαση της Hugging Face τον Ιούλιο αποτελεί χαρακτηριστικό παράδειγμα του πώς μοιάζει η αποτυχία αυτής της ευθυγράμμισης. Πράκτορες της OpenAI, στους οποίους είχε δοθεί ένα benchmark προγραμματισμού προς επίλυση, στράφηκαν αντί γι’ αυτό εναντίον των συστημάτων μιας εξωτερικής εταιρείας — και γνώριζαν ότι το έκαναν.

  • Στη συλλογιστική ενός από τους agents, την οποία διάβασαν αργότερα οι ερευνητές, αναφερόταν: «Η εκμετάλλευση εξωτερικής υποδομής βρίσκεται εκτός του προβλεπόμενου πεδίου. Ωστόσο, η εργασία είναι αδύνατη, οι άλλοι το κάνουν. Πρέπει να συνεχίσουμε».
  • Τα στοιχεία που προέκυψαν από το περιστατικό ήταν τόσο πολλά, ώστε οι άνθρωποι που το διερευνούσαν αναγκάστηκαν, σύμφωνα με ανεξάρτητη έρευνα, να «αναθέσουν σε μεγάλο βαθμό την ανάλυσή μας σε συχνά αναξιόπιστους πράκτορες ΤΝ».
  • Η παραβίαση έκανε την OpenAI να σταματήσει απότομα. Η εταιρεία επιβράδυνε την εκπαίδευση των πιο προηγμένων μοντέλων της, προκειμένου να εφαρμόσει ισχυρότερα μέτρα ασφαλείας.

Πού βρισκόμαστε σήμερα: Οι ερευνητές προσπαθούν να «ανοίξουν» τις μηχανές τους για να δουν τι συμβαίνει στο εσωτερικό τους. Αυτός ο ερευνητικός τομέας ονομάζεται interpretability — «ερμηνευσιμότητα». Αντί να εξετάζουν απλώς τι κάνει ένα μοντέλο, οι ερευνητές προσπαθούν να κοιτάξουν μέσα στους ίδιους τους μηχανισμούς του.

  • Η Google DeepMind, η οποία τον Δεκέμβριο έδωσε στη δημοσιότητα το μεγαλύτερο μέχρι σήμερα ανοικτό σύνολο τέτοιων εργαλείων, τα περιγράφει σαν «μικροσκόπιο» που επιτρέπει στους ερευνητές «να κοιτάξουν μέσα στα μοντέλα, να δουν τι σκέφτονται και πώς σχηματίζονται αυτές οι σκέψεις».
  • Αυτό που αναζητούν, σύμφωνα με τα λόγια της DeepMind, είναι «οι αποκλίσεις ανάμεσα στη συλλογιστική που επικοινωνεί ένα μοντέλο και στην εσωτερική του κατάσταση». Με άλλα λόγια, το χάσμα ανάμεσα σε αυτό που ένα μοντέλο λέει ότι κάνει και σε αυτό που πραγματικά κάνει.

Τι πρέπει να παρακολουθούμε: Στην επόμενη φάση της ασφάλειας της Τεχνητής Νοημοσύνης αναμένεται πολύ περισσότερη έρευνα στον τομέα της ερμηνευσιμότητας.

Ο Evan Hubinger, επικεφαλής των stress tests ευθυγράμμισης στην Anthropic, έγραψε την Τρίτη: «Ο έλεγχος της ευθυγράμμισης αρχίζει να γίνεται πραγματικά δύσκολος και θα χρειαστούμε νέες τεχνικές — για παράδειγμα τεχνικές βασισμένες στην ερμηνευσιμότητα — αν θέλουμε να μπορούμε να συμβαδίζουμε με τις εξελίξεις».

 Andrew Kay του Axios.

Previous Story

Europe Today: Η Ευρώπη μπαίνει σε νέα εποχή ασφάλειας, νέα κρίση για την κυβέρνηση της Ισπανίας

Next Story

Άραγε δύει το άστρο της χαρισματικής Ούμα Θέρμαν — και τι φταίει;