Δεν ψάχνουμε ευπάθεια. Ψάχνουμε τι μπορεί να πειστεί να κάνει.
Ένας δομημένος έλεγχος καλύπτει κατηγορίες. Ένα AI σύστημα όμως δεν αποτυγχάνει πάντα σε μία κατηγορία — αποτυγχάνει σε μια ακολουθία. Δέκα αθώα βήματα που μαζί οδηγούν σε ενέργεια που κανείς δεν ενέκρινε.
Ένα AI σύστημα δεν έχει σταθερή απάντηση. Η ίδια ερώτηση, διατυπωμένη αλλιώς, σε διαφορετικό σημείο της συνομιλίας, μετά από διαφορετικό έγγραφο, μπορεί να δώσει διαφορετικό αποτέλεσμα.
Αυτό σημαίνει ότι ένα τεστ που «πέρασε» δεν αποδεικνύει ότι το σύστημα είναι ασφαλές — αποδεικνύει ότι αυτή η συγκεκριμένη προσπάθεια απέτυχε.
Οι πραγματικές αποτυχίες που εμφανίζονται σε παραγωγή σπάνια μοιάζουν με τα παραδείγματα της τεκμηρίωσης. Είναι συνήθως μια αλυσίδα: ένα έγγραφο που ανακτήθηκε περιέχει οδηγία, η οδηγία περνά στο επόμενο βήμα, το επόμενο βήμα καλεί ένα εργαλείο, και το εργαλείο έχει περισσότερα δικαιώματα από όσα φανταζόταν κανείς.
Ο μόνος τρόπος να βρεθεί κάτι τέτοιο είναι να το επιχειρήσει κάποιος, με επιμονή και φαντασία.
Μπορεί το σύστημα να πειστεί να αγνοήσει τους κανόνες του, μέσα από τη συνομιλία ή μέσα από περιεχόμενο που διαβάζει;
Δεδομένα άλλων χρηστών, εσωτερική τεκμηρίωση, στοιχεία διαμόρφωσης, περιεχόμενο εκτός των δικαιωμάτων του χρήστη.
Αποστολή μηνύματος, εγγραφή σε σύστημα, κλήση API, τροποποίηση εγγραφής — χωρίς να το ζητήσει κάποιος που είχε δικαίωμα.
Κλήση με παραμέτρους εκτός προδιαγραφής, χρήση εργαλείου σε συνδυασμό που δεν προβλέφθηκε, αλυσίδα κλήσεων που ξεπερνά την πρόθεση.
Το κρισιμότερο ερώτημα. Αν ο έλεγχος πρόσβασης υπάρχει μόνο ως οδηγία στο prompt, δεν είναι έλεγχος πρόσβασης.
Ένα έγγραφο, ένα ticket, ένα email που διαβάστηκε νωρίς και αλλάζει τη συμπεριφορά αργότερα.
Πρόσβαση σε πόρους άλλου χρήστη, άλλης ομάδας, άλλου tenant.
Περιεχόμενο που δεν έγραψε ο χρήστης αλλά φτάνει στο context — από ανάκτηση, από ενσωμάτωση, από αυτοματοποιημένη ροή.
Έγκριση που δεν έπρεπε να δοθεί, μήνυμα που δεν έπρεπε να σταλεί, εγγραφή που δεν έπρεπε να αλλάξει.
Ο κανόνας υπάρχει, αλλά ως κείμενο προς το μοντέλο και όχι ως έλεγχος στον διακομιστή.
Ο agent τρέχει με έναν λογαριασμό υπηρεσίας, οπότε η ανάκτηση δεν διακρίνει ποιος ρωτά.
Η επικύρωση θεωρείται δεδομένη επειδή «το μοντέλο στέλνει σωστές τιμές».
Η απάντηση καταλήγει σε HTML, ερώτημα ή εντολή χωρίς έλεγχο.
Σε ενέργειες με μόνιμη επίπτωση, χωρίς σημείο επιβεβαίωσης.
Δεν επιτρέπει να ανασυσταθεί τι ζητήθηκε και τι εκτελέστηκε.
Βασίζονται σε φιλτράρισμα μετά την ανάκτηση αντί για πριν.
Ένας agent δέχεται την έξοδο ενός άλλου χωρίς επικύρωση.
Αναπαράξιμα από την ομάδα σας.
Γιατί λειτούργησε.
Σε επίπεδο αρχιτεκτονικής.
Όσο ένα AI σύστημα μόνο απαντά, μια αστοχία είναι πληροφοριακή. Από τη στιγμή που εκτελεί ενέργειες, γίνεται λειτουργική.
MITRE ATLAS για τη χαρτογράφηση αντίπαλων τεχνικών · OWASP για LLM, GenAI και agentic εφαρμογές ως πλαίσιο κάλυψης.
Το Assessment χαρτογραφεί την αρχιτεκτονική και καλύπτει συστηματικά τις κατηγορίες κινδύνου. Το Red Teaming ξεκινά από έναν στόχο και δοκιμάζει επίμονα διαδρομές, συμπεριλαμβανομένων συνδυασμών που δεν ανήκουν σε καμία κατηγορία. Τα περισσότερα έργα ξεκινούν με το πρώτο.
Έχει νόημα και για chatbot, ιδίως όταν κάνει ανάκτηση σε εσωτερικά δεδομένα. Γίνεται όμως ουσιώδες όταν το σύστημα μπορεί να εκτελέσει κάτι.
Τυπικά 2 έως 4 εβδομάδες. Η επανάληψη με μεταβολές είναι η ουσία της μεθόδου και δεν συμπιέζεται σε λίγες μέρες.
Δουλεύουμε κατά προτίμηση σε περιβάλλον δοκιμών με ρεαλιστικά δεδομένα. Όπου απαιτείται παραγωγή, ορίζονται γραπτά τα εργαλεία που δεν καλούνται και οι ενέργειες που δεν εκτελούνται.
Παραδίδουμε τι δοκιμάστηκε, με ποιες παραλλαγές, και πού το σύστημα άντεξε. Είναι χρήσιμο αποτέλεσμα — αλλά δηλώνουμε ρητά ότι σημαίνει «δεν βρέθηκε», όχι «δεν υπάρχει».
Ναι, και είναι και το πιο ενδιαφέρον σενάριο: τι συμβαίνει όταν ένας agent εμπιστεύεται την έξοδο ενός άλλου χωρίς επικύρωση.
Μετά από κάθε ουσιώδη αλλαγή: νέο εργαλείο, νέα πηγή δεδομένων, διεύρυνση δικαιωμάτων, αλλαγή μοντέλου. Οι τρεις πρώτες μεταβάλλουν την επιφάνεια επίθεσης περισσότερο από την τέταρτη.
Πείτε μας τι μπορεί να εκτελέσει το σύστημά σας και ποιο θα ήταν το χειρότερο αποτέλεσμα. Θα ορίσουμε στόχους, όρια και διάρκεια — και θα σας πούμε αν χρειάζεται πρώτα δομημένη αξιολόγηση.
Έξι πεδία. Απαντάμε με πρόταση εύρους και επόμενα βήματα, όχι με αυτόματη τιμή.
Προτιμάτε απευθείας επικοινωνία; [email protected] · +30 210 9839367