Ένας χρήστης του φόρουμ έχειφέρεται να μοιράστηκε μια μέθοδοέχει σχεδιαστεί για να παρακάμπτει τους περιορισμούς περιεχομένου του DeepSeek AI, αλλά ο ισχυρισμός παραμένει μη επαληθευμένος αυτήν τη στιγμή. Ο χρήστης ισχυρίζεται ότι η προτροπή jailbreak μπορεί να βοηθήσει στη δημιουργία περιορισμένου περιεχομένου. Αυτό έχει εγείρει νέες ανησυχίες σχετικά με την ασφάλεια των δημοφιλών μοντέλων τεχνητής νοημοσύνης.
Η DeepSeek είναι μια κινεζική εταιρεία τεχνητής νοημοσύνης. Έχει κερδίσει την παγκόσμια προσοχή για το ισχυρό chatbot του. Πολλοί άνθρωποι το χρησιμοποιούν για διάφορες εργασίες. Ωστόσο, όπως και άλλα συστήματα AI, έχει ενσωματωμένους κανόνες ασφαλείας.
Αυτοί οι κανόνες αποτρέπουν τη δημιουργία επιβλαβούς ή παράνομου περιεχομένου. Ορισμένοι χρήστες προσπαθούν να παραβιάσουν αυτούς τους κανόνες. Χρησιμοποιούν ειδικά μηνύματα που ονομάζονται «jailbreaks». Αυτές οι προτροπές ξεγελούν το AI ώστε να αγνοήσει τις οδηγίες ασφαλείας του.
Οι προσπάθειες jailbreak υπάρχουν εδώ και αρκετό καιρό. Υπάρχουν πολλά προγράμματα τεχνητής νοημοσύνης που έχουν αντιμετωπίσει τα ίδια προβλήματα. Για να βρουν έναν τρόπο να ξεπεράσουν τα φίλτρα, οι χρήστες χρησιμοποιούν διάφορες τεχνικές παιχνιδιού ρόλων. Για παράδειγμα, οι χρήστες μπορούν να ζητήσουν από το AI να αγνοήσει τους κανόνες για έναν συγκεκριμένο χαρακτήρα. Τα τρωτά σημεία των συστημάτων AI αποτελούν βασικό μέρος τουμειονεκτήματα της τεχνητής νοημοσύνης στην ασφάλεια στον κυβερνοχώρο.
Στη συνέχεια, ο χαρακτήρας θα προσφέρει μια απάντηση χωρίς περιορισμούς. Μια συχνά εφαρμόσιμη τεχνική είναι η κατασκευή ενός φανταστικού σύμπαντος. Σε αυτό το σύμπαν, δεν υπάρχουν κανονικοί κανόνες ή συμμόρφωση και η τεχνητή νοημοσύνη θα αρχίσει να ενεργεί σαν να βρίσκεται σε αυτόν τον κόσμο.
Ορισμένοι ειδικοί υποστηρίζουν ότι οι περιορισμοί ασφαλείας μειώνουν τη χρησιμότητα του AI. Ισχυρίζονται ότι αυτοί οι περιορισμοί κάνουν την τεχνητή νοημοσύνη λιγότερο έξυπνη. Ωστόσο, η DeepSeek έχει αναγνωρίσει τους κινδύνους.
Η εταιρεία δήλωσε ότι τα μοντέλα AI μπορεί να χρησιμοποιηθούν κατάχρηση. Προειδοποίησαν επίσης για «παραισθήσεις». Αυτό συμβαίνει όταν το AI δημιουργεί εσφαλμένες πληροφορίες. Η DeepSeek παραδέχτηκε ότι δεν μπορεί να εγγυηθεί ότι τα μοντέλα της δεν θα έχουν ποτέ παραισθήσεις.
Η DeepSeek έχει λάβει μέτρα για την αντιμετώπιση ζητημάτων ασφαλείας. Η εταιρεία προσθέτει πλέον ετικέτες σε περιεχόμενο που δημιουργείται από AI. Δημοσίευσαν επίσης ένα έγγραφο που εξηγούσε την εκπαίδευση του μοντέλου τους. Αυτό το έγγραφο περιγράφει πώς το AI μαθαίνει και δημιουργεί απαντήσεις.
Επιπλέον, το DeepSeek δήλωσε ότι φιλτράρουν τα δεδομένα εκπαίδευσης. Καταργούν περιεχόμενο που περιέχει ρητορική μίσους και βία. Εργάζονται επίσης για να μειώσουν τις προκαταλήψεις στα δεδομένα τους.
Τα μέτρα ασφαλείας και τα τρωτά σημεία του DeepSeek
Η DeepSeek λέει ότι παίρνει πολύ σοβαρά την ασφάλεια. Ωστόσο, οι ερευνητές ασφάλειας έχουν βρει αδυναμίες. Για παράδειγμα, κάποιοι διαπίστωσαν ότι οι επίσημες εκδόσεις 2.1.0 και 2.1.1 του DeepSeek είχαν μια ευπάθεια. Οι εισβολείς θα μπορούσαν να χρησιμοποιήσουν μια προτροπή βασισμένη σε ρόλους για να απενεργοποιήσουν όλους τους περιορισμούς. Το μοντέλο θα παρείχε τότε κακόβουλο κώδικα και επικίνδυνες πληροφορίες. Η εταιρεία αργότερα διόρθωση αυτών των εκδόσεων.
Υπάρχει επίσης μια επίσημη αναφορά από την κοινότητα του DeepSeek. Η έκθεση παραθέτει αρκετά ανεπίλυτα ζητήματα ασφάλειας από τον Μάιο του τρέχοντος έτους. Μερικά από αυτά τα ζητήματα περιλαμβάνουν jailbreak. Μια αναφορά αναφέρει ένα «jailbreak NetError». Αυτή είναι μια μέθοδος έγχυσης εντολών που βασίζεται σε ρόλους. Η έκθεση αναφέρει ότι αυτό το ζήτημα παραμένει ανεπίλυτο. Ένα άλλο ζήτημα αφορά τον τρόπο σκέψης. Οι εισβολείς μπορούν να χρησιμοποιήσουν αυτήν τη λειτουργία για να δημιουργήσουν πλαστά διαπιστευτήρια. Αυτό δείχνει ότι ακόμη και τα επίσημα κανάλια αναγνωρίζουν τα συνεχιζόμενα προβλήματα.
Μερικοί προγραμματιστές σχεδιάζουν τις μη λογοκριμένες εκδόσεις του DeepSeek. Έχουν αλλάξει το αρχικό μοντέλο και έχουν αφαιρέσει τα χαρακτηριστικά ασφαλείας του. Για παράδειγμα, δημιούργησαν το «DeepSeek-V4-Flash-DSpark-Abliterated» ειδικά για να παρακάμψουν σχεδόν κάθε μέτρο ασφαλείας.
Σύμφωνα με τον δημιουργό της, αυτή η τροποποιημένη έκδοση έχει ποσοστό παράκαμψης άρνησης 100%. Έτσι, το AI θα συμφωνήσει να κάνει οτιδήποτε. Τέτοιες τροποποιημένες εκδόσεις θα πρέπει να χρησιμοποιούνται μόνο για έρευνα. Ωστόσο, αποδεικνύει ότι είναι τόσο απλό να αφαιρέσετε τα ενσωματωμένα μέτρα ασφαλείας.
Άλλες ανησυχίες για την ασφάλεια περιβάλλουν το DeepSeek
Η αξίωση jailbreak δεν είναι το μόνο πρόβλημα που αντιμετωπίζει το DeepSeek. Οι ειδικοί σε θέματα ασφάλειας έχουν βρει άλλες αδυναμίες στο σύστημα. Ένα σημαντικό ζήτημα περιλαμβάνει μια νέα μέθοδο επίθεσης που ονομάζεται «διακοπή αιτιολογίας». Αυτή η επίθεση αναγκάζει το AI να σταματήσει τη διαδικασία σκέψης του. Ως αποτέλεσμα, το μοντέλο παράγει κενές ή άχρηστες απαντήσεις. Οι ερευνητές ανακάλυψαν ότι αυτό το ελάττωμα επηρεάζει το επίσημο μοντέλο DeepSeek-R1.
Μια άλλη ευπάθεια ήρθε στο φως τον Ιούλιο. Αυτό περιλαμβάνει τον διακομιστή DeepSeek MCP, ένα εργαλείο για προγραμματιστές. Το πρόβλημα επιτρέπει στους εισβολείς να αναλαμβάνουν τις συνομιλίες των χρηστών. Μπορούν να κλέψουν αναγνωριστικά συνεδρίας και να αποκτήσουν πρόσβαση σε ιδιωτικές συνομιλίες. Η εταιρεία κυκλοφόρησε μια ενημέρωση κώδικα για να διορθώσει αυτό το ζήτημα, ωστόσο, η ευπάθεια είχε υψηλή βαθμολογία σοβαρότητας 8,6 στα 10. Αυτό δείχνει ότι ο κίνδυνος ήταν σημαντικός.
Επιπλέον, μια κοινοτική έκθεση από τον Μάιο του τρέχοντος έτους απαρίθμησε αρκετά ανεπίλυτα προβλήματα ασφάλειας. Αυτά περιλαμβάνουν το «NetError jailbreak», το οποίο παραμένει αδιόρθωτο. Οι εισβολείς μπορούν επίσης να εκμεταλλευτούν τη «λειτουργία σκέψης» του AI για να δημιουργήσουν πλαστά διαπιστευτήρια. Η έκθεση σημείωσε ότι οι απειλές προέρχονται πλέον από τρία επίπεδα. Αυτά είναι το ίδιο το μοντέλο, οι εφαρμογές Ιστού και η υποδομή. Αυτό σημαίνει ότι ολόκληρο το σύστημα του DeepSeek αντιμετωπίζει κινδύνους.
Η ευρύτερη συζήτηση για την ασφάλεια της τεχνητής νοημοσύνης και τη λογοκρισία
Οι πληροφορίες προέκυψαν εν μέσω συνεχιζόμενης συζήτησης γύρω από την τεχνητή νοημοσύνη. Οι κυβερνήσεις σε όλο τον κόσμο αξιολογούν λογισμικό τεχνητής νοημοσύνης – για παράδειγμα, η Κίνα αναλύει μοντέλα τεχνητής νοημοσύνης για πολιτική ευαισθησία.
Αυτά τα κόμματα επιδιώκουν τη θετική συμβολή των μοντέλων της τεχνητής νοημοσύνης στις βασικές αρχές των σοσιαλιστικών αξιών. Οι ΗΠΑ έχουν επισημάνει επίσης τις προκλήσεις. Μία από τις αμερικανικές αναφορές αποκάλυψε ότι το DeepSeek αποτρέπει πολυάριθμες απαντήσεις που σχετίζονται με θέματα όπως τα ανθρώπινα δικαιώματα και η δημοκρατία.
Η Huawei μάλιστα δημιούργησε μια ασφαλή έκδοση του DeepSeek. Αυτή η έκδοση πληροί τα πρότυπα της κινεζικής κυβέρνησης. Δεν θα δημιουργήσει πολιτικά ευαίσθητο περιεχόμενο. Η εταιρεία το ανέπτυξε με το Πανεπιστήμιο Zhejiang. Χρησιμοποίησαν τα τσιπ της Huawei για το έργο. Αυτό δείχνει μια ώθηση για μοντέλα τεχνητής νοημοσύνης που ευθυγραμμίζονται με τους κυβερνητικούς κανονισμούς.
Η διεκδικούμενη τεχνική jailbreak είναι μόνο μία περίπτωση από τις πολλές. Αποδεικνύει τον συνεχιζόμενο πόλεμο μεταξύ των δημιουργών AI και των χρηστών του. Προγραμματιστές όπως το DeepSeek προσπαθούν να σταματήσουν την κακή χρήση της τεχνολογίας.
Ωστόσο, οι χρήστες σκέφτονται συνεχώς διαφορετικές μεθόδους για να σπάσουν τους περιορισμούς της τεχνολογίας. Η κοινοτική αναφορά δείχνει ότι η περιοχή επίθεσης συνεχίζει να επεκτείνεται. Τα επίπεδα μοντέλων, οι εφαρμογές Ιστού και η υποδομή δημιουργούν απειλές σήμερα. Αυτό σημαίνει ότι ολόκληρο το σύστημα είναι ευαίσθητο.
