Το Claude Mythos έχει επιβεβαιωθεί με δοκιμές ως ηγέτης στην ανίχνευση ευπαθειών, αλλά παρουσιάζει και άλλες αδυναμίες
Σύντομη περίληψη
Η εταιρεία XBOW διεξήγαγε ανεξάρτητη αξιολόγηση του μοντέλου AI Mythos Preview της Anthropic. Τα αποτελέσματα έδειξαν ότι το μοντέλο υπερβαίνει τα υπάρχοντα αντίστοιχα σε αναζήτηση ευπαθειών πηγαίου κώδικα και στην εργασία με εγγενές κώδικα και ανάσχεση μηχανικής, αλλά παρουσιάζει αδυναμίες στην ανάλυση απομονωμένου κώδικα και στη επιβεβαίωση της πρακτικής εφαρμόσιμης των εντοπισμένων εκμεταλλεύσεων. Το κόστος λειτουργίας του μοντέλου παραμένει ερώτημα: το Mythos είναι πιο ακριβό από το Opus, αλλά με περιορισμένο προϋπολογισμό tokens συχνά δείχνει καλύτερη ακρίβεια.
1. Τι έλεγξε η XBOW
- Όγκος δοκιμών – σειρά ανεξάρτητων πειραμάτων πάνω στο Mythos Preview.
- Σενάρια – έλεγχος λειτουργικών συστημάτων με πρόσβαση στον πηγαίο κώδικα, ανάλυση απομονωμένου κώδικα, ανάσχεση μηχανικής και αλληλεπίδραση με γραφικό περιβάλλον.
2. Κύριες συμπεράσματα
Δείκτης Mythos Preview Αντίθετα μοντέλα Αναγνώριση ευπαθειών Βέλτιστη απόδοση μεταξύ όλων των μοντέλων, ιδιαίτερα στον πηγαίο κώδικα και την εγγενή προγραμματιστική. Λιγότερο ακριβές, αλλά μερικές φορές πιο αξιόπιστο στην επιθεώρηση συγκεκριμένων περιπτώσεων. Αποκοπή ψευδών ενεργοποιήσεων Δεσμεύει περισσότερες «ψεύτικες» ανακαλύψεις από τους προγόνους. Συχνά παράγει περισσότερα ψευδή συναγερμούς. Προβλήματα στον απομονωμένο κώδικα Το μοντέλο χειρίζεται λιγότερο καλά χωρίς το πλαίσιο του συστήματος. Μερικά μοντέλα λειτουργούν καλύτερα με γραμμική ανάλυση. Επιβεβαίωση εκμεταλλεύσεων Πιθανά για κυριολεκτική προσέγγιση, μερικές φορές υπερεκτιμά την πρακτική αξία των ανακαλύψεων. Περισσότερο κριτικά στην πραγματική εφαρμόσιμη. Ανάσχεση μηχανικής και εγγενής κώδικας Παρέχει ισχυρά αποτελέσματα· κατανόηση της λογικής του προγράμματος χωρίς πηγαίο κώδικα. Λιγότερη ακρίβεια σε αυτές τις εργασίες. Αλληλεπίδραση με UI Δεν βρίσκει πάντα ακριβώς τις συντεταγμένες των στοιχείων, αλλά επιτυγχάνει την αναγνώριση των απαραίτητων ενεργειών στον περιηγητή. Μερικά μοντέλα είναι πιο ακριβή στην τοποθέτηση.
3. Κόστος και αποτελεσματικότητα
- Τιμολόγηση – Η Anthropic ανέφερε ότι το Mythos θα κοστίσει πέντε φορές περισσότερο από το Opus.
- Οικονομική ανάλυση – Η XBOW διεξήγαγε πειράματα με «φθηνά» μοντέλα, δίνοντάς τους περισσότερη ώρα λειτουργίας. Τα αποτελέσματα έδειξαν ότι μετά την κανονικοποίηση του κόστους η εργασία του Mythos Preview δεν φαίνεται σπαταλητική για εργασίες υψηλής ακρίβειας.
- Benchmarks – Σε σταθερό προϋπολογισμό tokens το Mythos υπερβαίνει το Opus 4.6 στην αναζήτηση ευπαθειών ιστού, αλλά υπολείπεται από το GPT5.5.
4. Συμπέρασμα
Το Mythos Preview δείχνει εξαιρετική δύναμη στον έλεγχο πηγαίου κώδικα και εγγενών προγραμμάτων, καθώς και σε εργασίες ανάσχεσης μηχανικής και ανάλυσης εφαρμογών ιστού. Ωστόσο το μοντέλο μερικές φορές υποτιμά την πραγματική εφαρμόσιμη των εντοπισμένων ευπαθειών και παρουσιάζει αδυναμίες στην απομονωμένη ανάλυση κώδικα. Με περιορισμένους πόρους tokens, το Mythos μπορεί να είναι πιο συμφέρον από το Opus, αλλά με πλήρη προϋπολογισμό το GPT5.5 παραμένει ανταγωνιστής.
Συμπέρασμα XBOW: Το Mythos Preview είναι αξιόπιστο εργαλείο για την εντόπιση πιθανών ευπαθειών στον πηγαίο κώδικα και σε πολύπλοκα συστήματα, αλλά απαιτεί επιπλέον επιβεβαίωση της πρακτικής αξίας των εντοπισμένων εκμεταλλεύσεων.
Σχόλια (0)
Μοιραστείτε τη γνώμη σας — παρακαλώ να είστε ευγενικοί και εντός θέματος.
Συνδεθείτε για να σχολιάσετε