Οι ερευνητές της Microsoft δηλώνουν ότι τα μοντέλα AI δεν είναι ακόμη ικανοί να επιλύουν σύνθετες εργασίες.
Οι ερευνητές της Microsoft εντοπίστηκαν περιορισμούς των σύγχρονων μεγάλων γλωσσικών μοντέλων (LLM) στην εκτέλεση σύνθετων πολλαπλών εργασιών
Στα πλαίσια πειραμάτων, η Microsoft Research διαπίστωσε ότι ακόμη και τα πιο εξελιγμένα μοντέλα AI κάνουν σοβαρά λάθη όταν τους ανατίθενται να εκτελούν μακροχρόνιες και πολυεтапικές διαδικασίες. Μεταξύ των δοκιμασμένων συστημάτων — Gemini 3.1 Pro, Claude 4.6 Opus και GPT 5.4 — κατά μέσο όρο κάθε μοντέλο έχασε περίπου 25 % του περιεχομένου των εγγράφων μετά την αυτόνομη επεξεργασία.
Τι ακριβώς δοκιμάστηκε
* Benchmark DELEGATE‑52
Δημιουργήθηκε από την ομάδα του Φίλιπ Λάμπαν, του Τόβιας Σνάβελ και της Τζέννιφερ Νέβιλ. Προσομοιώνει εργασίες σε 52 επαγγελματικούς τομείς: από προγραμματισμό και σημειογραφία μέχρι κρυσταλλογραφία.
* Κριτήριο αξιολόγησης
Τα μοντέλα αξιολογήθηκαν με βάση την ακεραιότητα του εγγράφου μετά από 20 κύκλους επεξεργασίας. Ο όριο «ετοιμότητας» ορίστηκε στο επίπεδο 98 % – αν το αποτέλεσμα πέφτει κάτω, η εργασία θεωρείται αποτυχημένη.
Κύρια συμπεράσματα
Πεδίο Καλύτερα αποτελέσματα Προγραμματισμός Οι πιο ισχυρές επιδόσεις Φυσική γλώσσα Τα λιγότερο αξιόπιστα μοντέλα
* Πτώση ποιότητας
Σε πάνω από το 80 % των συνδυασμών εγγράφων η ποιότητα πέφτει στο 80 % ή χαμηλότερα. Το καλύτερο μοντέλο (Gemini 3.1 Pro) πληρούσε τα κριτήρια ετοιμότητας μόνο σε 11 από τις 52 τομείς.
* Δονταρισμένα λάθη
Οι απώλειες δεν συνέβαιναν σταδιακά, αλλά «με δόσεις»: σε έναν κύκλο αλληλεπίδρασης το μοντέλο μπορούσε να χάσει από 10 έως 30 % της ακρίβειας. Τα πιο εξελιγμένα μοντέλα (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) προσπαθούσαν να αποφύγουν μικρά λάθη, αναβάλλοντας την επεξεργασία τους σε μεταγενέστερα στάδια και μειώνοντας τον αριθμό αλληλεπιδράσεων.
* Διαχείριση με πράκτορα
Με τη χρήση εργαλείων σε λειτουργία διαχείρισης πρακτόρων, τα αποτελέσματα δεν βελτιώθηκαν: προς το τέλος του κύκλου η ποιότητα πέφτει περίπου κατά 6 %.
Τι σημαίνει αυτό για τους χρήστες
Οι επιστήμονες τονίζουν ότι οι χρήστες εξακολουθούν να πρέπει να παρακολουθούν προσεκτικά τη λειτουργία των συστημάτων AI όταν τους αναθέτουν εξουσίες. Τα τρέχοντα μοντέλα μπορούν να λειτουργούν αυτόνομα μόνο σε στενούς τομείς.
Ωστόσο, οι συγγραφείς του benchmark σημειώνουν αξιοσημείωτη πρόοδο: η οικογένεια μοντέλων OpenAI βελτίωσε τις επιδόσεις από 14,7 % έως 71,5 % μέσα σε 16 μήνες. Αυτό επιβεβαιώνει ότι τα LLM συνεχίζουν να εξελίσσονται, αλλά εξακολουθούν να περιορίζονται σε σύνθετες πολλαπλές εργασίες.
Σχόλια (0)
Μοιραστείτε τη γνώμη σας — παρακαλώ να είστε ευγενικοί και εντός θέματος.
Συνδεθείτε για να σχολιάσετε