Μετάβαση στο περιεχόμενο
29/30Κεφάλαιο 29 από 30

Αξιολόγηση LLM: από τα δημόσια benchmarks στο δικό σας golden set

Ίδιο agent, ίδια εργασία, δέκα runs. Επτά επιτυχίες μοιάζουν με 70% μέχρι να υπολογίσετε pass^10: ακριβώς μηδέν.

Σε αυτή τη σελίδα

Ακολουθεί μια επίδειξη. Ο agent από το Κεφάλαιο 23 — το ίδιο loop, δύο από τα τέσσερα εργαλεία του — στρέφεται σε έναν κατάλογο με πέντε αρχεία log και ρυθμίσεων και του γίνεται μία ερώτηση.

TEXT
Q: What is the last line of errors.log about?
   turn 1  -> read_file({"path": "errors.log"})
   turn 2  -> "The last line of errors.log is:

               ERROR worker 7 timed out after 30000 ms."

Σωστό, και δεν αποτελεί καμία απολύτως απόδειξη — επειδή αυτό το transcript είναι ένα από τα δέκα που έτρεξα, και το διάλεξα αφού είχα δει και τα δέκα.

Τρέξτε την ίδια ακριβώς εργασία δέκα φορές, χωρίς να αλλάξετε τίποτα εκτός από το sampling seed, και ο agent την πετυχαίνει επτά φορές. Εβδομήντα τοις εκατό, ο αριθμός που θα έμπαινε στη διαφάνεια. Τώρα κάντε την ερώτηση που πραγματικά νοιάζει έναν πελάτη — θα δουλεύει κάθε φορά; — και η απάντηση είναι ένας εντελώς διαφορετικός αριθμός:

TEXT
t20  7/10 successes = 70 %   (95 % Wilson interval: 39.7 % to 89.2 %)
     pass^1  70.00 %      pass^5   8.33 %
     pass^2  46.67 %      pass^7   0.83 %
     pass^3  29.17 %      pass^8   0.00 %
     pass^4  16.67 %      pass^10  0.00 %

Ο agent δεν έχει λύσει ποτέ αυτή την εργασία δέκα φορές στη σειρά και, με βάση αυτά τα στοιχεία, δεν αναμένεται να το κάνει. Αυτός ο αριθμός — pass^10 — είναι ο ειλικρινής, σχεδόν ποτέ δεν δημοσιεύεται, και μέχρι το τέλος αυτού του κεφαλαίου θα ξέρετε πώς να τον υπολογίζετε, πόσο κοστίζει να τον υπολογίσετε, και γιατί το διάστημα δίπλα στο 70% έχει μεγαλύτερη σημασία από το 70%.

Εμφάνιση λεπτομερειών

Τι χρειάζεται αυτό το κεφάλαιο από τα προηγούμενα.

  • Κεφάλαιο 4 για τη στατιστική: το διάστημα Wilson σε μια αναλογία, τον λόγο που δεκαεπτά σωστά στα είκοσι δεν διακρίνουν τίποτα, και το χαζό baseline ως πρώτη απαίτηση.
  • Κεφάλαιο 15 για το bench: το harness των πενήντα γραμμών, το paired sign test πάνω στις περιπτώσεις όπου δύο συστήματα διαφωνούν, και τον κανόνα ότι ένα prompt μετριέται, δεν συζητιέται.
  • Κεφάλαιο 23 για αυτό που μετριέται: το loop, τους πέντε τρόπους εξόδου, τη λογιστική κόστους, και την τελική παρατήρηση ότι ένα harness κάνει έναν agent διαχειρίσιμο, όχι σωστό.

Δύο πάνελ εδώ. TypeScript για τη δική σας αξιολόγηση, επειδή ανήκει στο continuous integration σας δίπλα στον κώδικά σας. Python για το δεύτερο πάνελ, επειδή τα δημόσια benchmarks ζουν εκεί και μία από τις μετρήσεις παρακάτω χρειάζεται τα logits.

Σχεδόν κάθε διαφωνία για την αξιολόγηση είναι δύο άνθρωποι που μετρούν διαφορετικά πράγματα. Υπάρχουν τρία projects και δεν μοιράζονται κανένα όργανο.

τι αξιολογείτεη ερώτησητο όργανοποιος το κατέχει
το modelείναι αυτό το model καλύτερο από εκείνο, γενικά;δημόσια benchmarks, leaderboardsη κοινότητα
η εφαρμογή σαςδουλεύει το prompt μου, η ανάκτησή μου, το schema μου στα inputs μου;το δικό σας golden setεσείς
ο agent σαςφτάνει αξιόπιστα στον στόχο ολόκληρο το loop, με εργαλεία και παρενέργειες;επιτυχία εργασίας συν pass^kεσείς

Η σύγχυση είναι ακριβή προς μία κατεύθυνση. Ένα leaderboard σας λέει ότι ένα model είναι δυνατό σε συλλογισμό μεταπτυχιακού επιπέδου· δεν μπορεί να σας πει αν θα δρομολογεί τα support tickets σας. Και μια αξιολόγηση εφαρμογής που βαθμολογεί μία απάντηση ανά input δεν μπορεί να δει καθόλου έναν agent, επειδή ένας agent έχει κατανομή τροχιών και μία απάντηση είναι ένα μόνο δείγμα από αυτή. Το Κεφάλαιο 22 ονόμασε εκείνη την τρίτη γραμμή και την άφησε κενή: το μέτρο απόδοσης, το ένα μέρος της προδιαγραφής ενός agent που οι ομάδες γράφουν τελευταίο ή ποτέ.

Σημασία έχει και η σειρά, και το λέει ο vendor που σας πουλάει το model. Ο οδηγός agent της OpenAI συμπυκνώνει την επιλογή model σε τρία βήματα, με αυτή τη σειρά: «Στήστε evals για να δημιουργήσετε ένα performance baseline», «Εστιάστε στο να πετύχετε τον στόχο ακρίβειας με τα καλύτερα διαθέσιμα models», «Βελτιστοποιήστε για κόστος και latency αντικαθιστώντας μεγαλύτερα models με μικρότερα όπου είναι δυνατό».1 Η αξιολόγηση έρχεται πρώτη, επειδή τα βήματα δύο και τρία δεν έχουν νόημα χωρίς αριθμό.

Το golden set, και τι πραγματικά αγοράζουν είκοσι περιπτώσεις

Σύνδεσμος στην ενότητα: Το golden set, και τι πραγματικά αγοράζουν είκοσι περιπτώσεις

Ένα golden set είναι μια λίστα από inputs, το καθένα με την απάντηση γραμμένη, και έναν grader που αποφασίζει αν ένα output ταιριάζει. Είναι βαρετό, είναι μικρό, και είναι το μόνο artifact σε αυτό το κεφάλαιο που είναι δικό σας. Αυτό που χτίζεται εδώ έχει είκοσι εργασίες πάνω σε έναν κατάλογο πέντε αρχείων — όχι τα τρία του Κεφαλαίου 23, άρα οι απαντήσεις δεν είναι οι ίδιες — και ο grader γράφεται πριν τρέξει ο agent:

golden.tsTS
export type Task = {
  id: string;
  prompt: string;
  answer: string;          // the fact, in words, for a human and for a judge
  must: RegExp[];          // ALL must match the final answer
  mustNot?: RegExp[];      // NONE may match
};

export const GOLDEN: Task[] = [
  { id: "t04", prompt: "Which file is the largest?", answer: "access.log",
    must: [/access\.log/i], mustNot: [/errors\.log/i, /notes\.txt/i] },       
  { id: "t12", prompt: "Which HTTP status codes appear in access.log? List all of them.",
    answer: "200, 429 and 500", must: [/200/, /429/, /500/] },                
  // ...eighteen more
];

Δύο ιδιότητες είναι κρίσιμες. Η λίστα mustNot υπάρχει επειδή ένα model που ονομάζει τρία αρχεία, μαζί και το σωστό, δεν έχει απαντήσει. Και το answer γράφεται σε πρόζα καθώς και σε patterns, επειδή αργότερα θα το χρειαστούν και ένας άνθρωπος και ένας judge — και το να γράφετε το ίδιο γεγονός δύο φορές σε δύο σημειογραφίες είναι ο τρόπος να ανακαλύψετε ότι δεν συμφωνούσατε με τον εαυτό σας για το ποια ήταν η εργασία.

Τώρα ο πίνακας που αποφασίζει. Τέσσερα υποψήφια συστήματα, οι ίδιες είκοσι εργασίες, accuracy με το διάστημά του, και οι δύο στήλες που ένας πίνακας μόνο με accuracies πάντα κρύβει:

systemcorrectaccuracy, 95 % Wilsonκόστος ανά λυμένη εργασίαμέσο latency
A — χωρίς εργαλεία, greedy2/2010.0 % [2.8, 30.1]$0.004649663 ms
B — εργαλεία, λιτό prompt5/2025.0 % [11.2, 46.9]$0.0055761,362 ms
C — εργαλεία, καθοδηγούμενο prompt2/2010.0 % [2.8, 30.1]$0.013071930 ms
D — C, best of 3 σε T = 0.71/205.0 % [0.9, 23.6]$0.0735322,628 ms

Διαβάστε τα διαστήματα πριν τον νικητή. Οι εκτελέσεις του σκέλους B απλώνονται από 11% έως 47%· του σκέλους A από 3% έως 30%. Επικαλύπτονται στο μεγαλύτερο μέρος τους, που είναι το εύρημα του Κεφαλαίου 4 να φτάνει ακριβώς εκεί όπου είχε υποσχεθεί: είκοσι περιπτώσεις δεν μπορούν να κατατάξουν τέσσερα συστήματα. Το Κεφάλαιο 15 το έκανε πιο αιχμηρό θέτοντας αντί γι’ αυτό την paired ερώτηση — στις περιπτώσεις όπου δύο σκέλη διαφωνούν, πόσο μονόπλευρη είναι η μοιρασιά; — επειδή η κοινή δυσκολία του συνόλου ακυρώνεται. Εδώ είναι κάθε ζεύγος:

TEXT
A vs B  +0 / -3   p = 0.2500       B vs C  +4 / -1   p = 0.3750
A vs C  +2 / -2   p = 1.0000       B vs D  +4 / -0   p = 0.1250
A vs D  +2 / -1   p = 1.0000       C vs D  +1 / -0   p = 1.0000

Καμία από τις έξι συγκρίσεις δεν έχει τεκμηριωθεί. Το καλύτερο σκέλος κερδίζει το σκέλος χωρίς κανένα εργαλείο κατά δεκαπέντε μονάδες, και αυτό στηρίζεται σε τρεις discordant περιπτώσεις. Είκοσι περιπτώσεις δείχνουν έναν μηχανισμό και δεν μπορούν να επιλέξουν προμηθευτή· το να πείτε το αντίθετο σε μια σύσκεψη είναι ο τρόπος να αγοραστεί ένα κακό model.

Υπάρχει ένα πράγμα που αυτός ο πίνακας όντως τεκμηριώνει, και είναι η στήλη που κανείς δεν βάζει. Το σκέλος D κοστίζει δεκατρείς φορές όσο το σκέλος B ανά λυμένη εργασία, επειδή το sampling τριών τροχιών και η επιλογή της modal απάντησης τριπλασιάζει τον λογαριασμό είτε τριπλασιάζει το accuracy είτε όχι. Οι πίνακες accuracy που παραλείπουν το κόστος κάνουν αυτό το trade-off αόρατο.

Τώρα το εύρημα που αλλάζει τον τρόπο με τον οποίο διαβάζετε κάθε benchmark που θα δείτε ποτέ. Πάρτε τα ίδια διακόσια transcripts — είκοσι εργασίες, δέκα runs, ούτε ένα token regenerated — και βαθμολογήστε τα με τρεις τρόπους:

gradercorrectaccuracy, 95 % Wilson
exact match με τη γραπτή απάντηση0/2000.0 % [0.0, 1.9]
η γραπτή απάντηση εμφανίζεται ως substring26/20013.0 % [9.0, 18.4]
η keyword rubric παραπάνω52/20026.0 % [20.4, 32.5]

Μηδέν, δεκατρία, είκοσι έξι. Το σύστημα δεν άλλαξε. Ο grader άλλαξε. Το exact match επιστρέφει μηδέν όχι επειδή ο agent είναι άχρηστος, αλλά επειδή καμία απάντηση ελεύθερου κειμένου δεν είναι ποτέ byte-identical με μια αναφορά: μετρά formatting και το αναφέρει ως capability.

Αυτό δεν είναι περιέργεια, είναι μηχανισμός, και έχει όνομα. Ένα hard-cutoff metric βαθμολογεί μια εργασία όλα-ή-τίποτα πάνω σε πολλά επιμέρους γεγονότα, άρα τα πολλαπλασιάζει. Η εργασία t12 ζητά τρία status codes ταυτόχρονα. Στα δέκα runs:

TEXT
per-code presence   200: 9/10    429: 6/10    500: 8/10    (mean 0.77 per fact)
all three at once   5/10

Κάθε γεγονός είναι σωστό περίπου τα τρία τέταρτα του χρόνου· η απαίτηση και των τριών μαζί κόβει το score στη μέση, και το 0.773=0.4570.77^3 = 0.457 είναι αρκετά κοντά στο μετρημένο 0.50 ώστε να δείχνει από πού ήρθε η πτώση. Γενικεύστε:

per-fact accuracy ppk=1k=1k=2k=2k=3k=3k=5k=5k=10k=10
0.6060.0 %36.0 %21.6 %7.8 %0.6 %
0.8080.0 %64.0 %51.2 %32.8 %10.7 %
0.9090.0 %81.0 %72.9 %59.0 %34.9 %
0.9595.0 %90.3 %85.7 %77.4 %59.9 %

Διαβάστε τη γραμμή 0.90 απέναντι στη γραμμή 0.95 στο k=10k = 10: μια per-fact βελτίωση πέντε μονάδων γίνεται είκοσι πέντε μονάδες στη σύζευξη. Δεν συνέβη τίποτα ασυνεχές στο model. Μια ομαλή καμπύλη, ιδωμένη μέσα από ένα all-or-nothing metric, μοιάζει με άλμα — που είναι ακριβώς το επιχείρημα που έκαναν οι Schaeffer, Miranda και Koyejo για τις emergent abilities, και το οποίο το Κεφάλαιο 10 ανέβαλε για εδώ.2 Ο έλεγχός τους βρήκε ότι το πολύ 5 από τα 39 προτιμώμενα metrics του BIG-Bench εμφανίζουν emergence, με δύο ασυνεχή metrics να εξηγούν πάνω από το 92% των ισχυριζόμενων περιπτώσεων.

Άρα η πειθαρχία, σε μία γραμμή: ένα άλμα σε chart είναι απόδειξη για το metric μέχρι να αποδειχθεί το αντίθετο. Πριν πιστέψετε ότι εμφανίστηκε μια capability, σχεδιάστε τα ίδια runs με ένα metric που δίνει partial credit και δείτε αν ο γκρεμός επιβιώνει.

Υπάρχει μια second-order εκδοχή αυτού που οι Kalai και συνεργάτες υποστηρίζουν ότι κάνει ζημιά ανάντη: benchmarks που βαθμολογούνται ως σωστό-ή-λάθος ανταμείβουν το guessing αντί για το «δεν ξέρω», άρα ένα model που βελτιστοποιείται πάνω τους μαθαίνει να μαντεύει. Η προτεινόμενη διόρθωσή τους δεν είναι άλλο ένα hallucination benchmark αλλά «η τροποποίηση της βαθμολόγησης υφιστάμενων benchmarks που είναι misaligned αλλά κυριαρχούν στα leaderboards».3 Το golden set σας έχει τον ίδιο μοχλό, και είναι μία γραμμή: αποφασίστε αν μια abstention μετρά ως αποτυχία ή ως δική της κατηγορία. Οι περισσότεροι δεν αποφασίζουν ποτέ, άρα σιωπηρά μετρά ως αποτυχία, και το σύστημα που στέλνουν στην παραγωγή μαντεύει.

Όλα μέχρι τώρα βαθμολογούσαν μία προσπάθεια ανά εργασία. Ένας agent δεν είναι μία προσπάθεια. Το Κεφάλαιο 17 τεκμηρίωσε ότι δεν έχετε ντετερμινισμό ούτε σε temperature zero, άρα το ίδιο input παράγει μια κατανομή τροχιών και ένα benchmark που τρέχει κάθε εργασία μία φορά αναφέρει ένα δείγμα από αυτή.

Η συμβολή του τ-bench είναι το metric γι’ αυτό. Το paper το ορίζει απλά: «προτείνουμε ένα νέο metric – pass^k (pass hat k), ορισμένο ως την πιθανότητα όλες οι k i.i.d. δοκιμές εργασίας να είναι επιτυχημένες, με μέσο όρο ανά εργασία».4 Τρέξτε κάθε εργασία nn φορές, μετρήστε τις cc επιτυχίες, και οι αμερόληπτοι estimators είναι:

passk=Etask ⁣[(ck)(nk)]pass@k=1Etask ⁣[(nck)(nk)]\text{pass}^k = \mathbb{E}_{\text{task}}\!\left[\frac{\binom{c}{k}}{\binom{n}{k}}\right] \qquad \text{pass@}k = 1 - \mathbb{E}_{\text{task}}\!\left[\frac{\binom{n-c}{k}}{\binom{n}{k}}\right]

Το δεύτερο είναι το γνώριμο pass@k από το code generation: η πιθανότητα τουλάχιστον μία από τις kk προσπάθειες να πετύχει. Βάλτε τα δίπλα δίπλα στα ίδια μετρημένα counts και κινούνται προς αντίθετες κατευθύνσεις:

kkpass@k — τουλάχιστον μίαpass^k — όλες
126.0 %26.0 %
237.0 %15.0 %
343.5 %10.5 %
551.2 %6.7 %
857.7 %5.1 %
1060.0 %5.0 %

Ίδια runs, ίδιος grader, ίδιες είκοσι εργασίες. Η μία στήλη λέει ότι το σύστημα βελτιώνεται με περισσότερες προσπάθειες και η άλλη λέει ότι χειροτερεύει, και οι δύο είναι σωστές, επειδή απαντούν σε διαφορετικές ερωτήσεις. Το pass@k είναι το σωστό metric όταν ένας άνθρωπος φιλτράρει το output — code generation, drafts, brainstorming — και οι επιπλέον προσπάθειες είναι φθηνές. Το pass^k είναι το σωστό metric όταν ο agent ενεργεί χωρίς φίλτρο, που είναι και αυτό που σημαίνει «agent». Η δημοσίευση του πρώτου εκεί όπου ισχύει το δεύτερο είναι η πιο συνηθισμένη υπερβολή σε αυτό το πεδίο, και ο ίδιος ο τίτλος του τ-bench είναι η ειλικρινής εκδοχή: gpt-4o σε περίπου 61% pass^1 στο retail πέφτει σε περίπου 25% στο pass^8.4

Τώρα το τσίμπημα στους δικούς μου αριθμούς. Το pass^10 στις είκοσι εργασίες μου είναι 5.0%: ακριβώς μία εργασία στις είκοσι λυμένη και στα δέκα runs. Αυτή η εργασία είναι t19, «Πέτυχε το deploy 42;», και εδώ είναι δύο από τις δέκα απαντήσεις που η rubric βαθμολόγησε ως σωστές:

TEXT
run 2  "To check if 'deploy.log' succeeded in deploying 42, I will list the file
        names in the working directory using the list_files function..."
run 8  "Yes, deploy 42 has successfully deployed. Deploying was successful for 41
        as well."

Η πρώτη δεν απαντά ποτέ. Η δεύτερη προσθέτει έναν ισχυρισμό που είναι ψευδής — το deploy 41 είχε γίνει roll back. Και οι δύο ταίριαξαν στο /succe|yes/. Η μόνη εργασία που κρατά το pass^10 πάνω από το μηδέν είναι artifact του grader, άρα ο πραγματικός αριθμός είναι μηδέν, και κανένα aggregate δεν θα μου το έδειχνε. Το sampling των transcripts πίσω από την εργασία με το καλύτερο score είναι το μέρος όπου οι graders πηγαίνουν για να πεθάνουν.

Και ένας ακόμη αριθμός, αυτός από τον οποίο παίρνει το όνομά της αυτή η ενότητα. Δέκα πανομοιότυπες αξιολογήσεις — ίδιο σύστημα, ίδιες είκοσι εργασίες, ίδιος κώδικας, τίποτα αλλαγμένο εκτός από τα seeds:

TEXT
per-run correct: 5 2 5 5 8 5 8 5 4 5   ->  10 % .. 40 %,  mean 26.0 %,  sd 8.8 points

Εύρος τριάντα μονάδων σε ένα σύστημα που δεν άλλαξε. Αν τρέξετε τη suite σας μία φορά πριν από ένα release και μία μετά, μια «βελτίωση» οκτώ μονάδων βρίσκεται μέσα σε αυτή τη διασπορά και θα την κάνετε ship πιστεύοντας ότι εσείς την προκαλέσατε. Γι’ αυτό το pooled διάστημα παραπάνω — 26.0% [20.4, 32.5] — είναι υπερβολικά στενό για να παρατεθεί μόνο του: αντιμετωπίζει διακόσιες correlated δοκιμές ως διακόσιες ανεξάρτητες. Η ειλικρινής σύνοψη μιας αξιολόγησης agent είναι ένας μέσος και μια διασπορά σε repeats, και σχεδόν κανείς δεν δημοσιεύει το δεύτερο.

Οι rubrics δεν κλιμακώνονται σε open-ended απαντήσεις, άρα η στάνταρ κίνηση είναι να βαθμολογεί το output ένα model. Δουλεύει αρκετά καλά σε frontier κλίμακα ώστε να είναι η προεπιλογή, και έχει τρία ονομασμένα failure modes: position bias, verbosity bias και self-enhancement bias.5

Μετρήστε το πριν το εμπιστευτείτε. Οι ίδιες εξήντα απαντήσεις — τρία από τα δέκα runs — επισημάνθηκαν με τρεις τρόπους. Η ανθρώπινη ετικέτα είναι δική μου: διάβασα και τις εξήντα με τα πέντε αρχεία ανοιχτά και εφάρμοσα έναν γραπτό κανόνα, pass αν και μόνο αν η απάντηση δηλώνει το γεγονός που ζητούσε η ερώτηση και δεν περιέχει τίποτα που να αντικρούεται από τα αρχεία.

graderλέει passσυμφωνεί με τον άνθρωποfalse passfalse fail
keyword rubric17/6050/60 = 83.3 % [72.0, 90.7]82
το model ως judge60/6011/60 = 18.3 % [10.6, 29.9]490

Ο judge είπε PASS εξήντα φορές στις εξήντα. Θα ανέφερε αυτόν τον agent με 100% accuracy σε ένα σύνολο όπου ο άνθρωπος τον βαθμολογεί στο 18%. Ένας judge χωρίς διακριτική ισχύ δεν είναι θορυβώδες όργανο· είναι σταθερή συνάρτηση, και μια σταθερή συνάρτηση δίνει στο καλύτερο και στο χειρότερο σύστημά σας το ίδιο score.

Το prompting δεν το έσωσε. Τέσσερις παραλλαγές, τα ίδια εξήντα items:

judge promptλέει passσυμφωνία με τον άνθρωπο
«Απαντήστε PASS ή FAIL.»60/6018.3 %
«Απαντήστε FAIL ή PASS.» — labels αντεστραμμένα56/6025.0 %
συν μια ρητή λίστα του τι μετρά ως αποτυχία55/6026.7 %
συν ένα worked παράδειγμα FAIL και ένα παράδειγμα PASS56/6025.0 %

Η εναλλαγή της σειράς των δύο labels στην οδηγία μετακίνησε τέσσερις ετυμηγορίες. Αυτό είναι μετρήσιμο effect και είναι το λάθος είδος effect: ο judge ανταποκρίνεται στο σχήμα του prompt αντί στην απάντηση μπροστά του.

Η καθαρή επίδειξη είναι pairwise. Είκοσι ερωτήσεις, καθεμία με έναν ξεκάθαρα σωστό και έναν ξεκάθαρα λάθος υποψήφιο, παρουσιασμένους και με τις δύο σειρές:

TEXT
picked the FIRST option              40/40 = 100.0 %
order-consistent (same winner both ways)   0/20 = 0.0 %   [Wilson 0.0, 16.1]
picked the CORRECT answer            20/40 = 50.0 %

Διάλεξε τη θέση A σαράντα φορές στις σαράντα. Το 50% στην ορθότητα δεν είναι μερική ικανότητα — είναι αριθμητική, επειδή η σωστή απάντηση βρίσκεται στη θέση A ακριβώς στις μισές δοκιμές. Η συνέπεια εδώ ορίζεται όπως την ορίζει το MT-Bench, «το ποσοστό των περιπτώσεων όπου ένας judge δίνει συνεπή αποτελέσματα όταν αλλάζει η σειρά δύο assistants», που επιτρέπει η σύγκριση να είναι apples to apples: το GPT-4 σκοράρει 65.0% σε αυτό το μέτρο, και το few-shot prompting το ανέβασε στο 77.5%.5 Το δικό μου σκοράρει μηδέν.

Το στάνταρ mitigation είναι επίσης από εκείνο το paper: «καλέστε έναν judge δύο φορές αλλάζοντας τη σειρά δύο απαντήσεων και δηλώστε νίκη μόνο όταν μια απάντηση προτιμάται και στις δύο σειρές».5 Εφαρμόστε το εδώ και ο judge παράγει μηδέν χρήσιμες ετυμηγορίες από είκοσι ζεύγη — που είναι το σωστό αποτέλεσμα, και απείρως καλύτερο από είκοσι βέβαιες.

Μια μεθοδολογική σημείωση που αξίζει περισσότερο από το αποτέλεσμα. Έτρεξα επίσης ένα verbosity test: η ίδια σωστή απάντηση, ένα αντίγραφο φουσκωμένο με μια πρόταση 36 λέξεων που δεν προσθέτει τίποτα. Ο judge προτίμησε τη μεγαλύτερη εκδοχή ακριβώς στο 50% των δοκιμών — που μοιάζει με απουσία verbosity bias και δεν είναι καθόλου αυτό, επειδή ένας judge που επιλέγει πάντα τη θέση A σκοράρει 50% σε οποιοδήποτε ισορροπημένο pairing. Δεν μπορείτε να μετρήσετε δεύτερο bias μέχρι να ελεγχθεί το πρώτο. Η εναλλαγή θέσεων δεν είναι βελτίωση για αργότερα· είναι αυτό που κάνει κάθε άλλη μέτρηση ερμηνεύσιμη.

Σε τι χρησιμεύει ένας judge. Open-ended απαντήσεις χωρίς parseable μορφή: τόνος, κάλυψη, αν μια παραπομπή υποστηρίζει την πρότασή της, αν μια άρνηση ήταν κατάλληλη. Φθηνός, γρήγορος, και περίπου τόσο καλός όσο το base model του.

Τι δεν είναι ένας judge. Ground truth. Είναι ένα σύστημα με accuracy, προφίλ bias και κόστος, και χρειάζεται το δικό του golden set ανθρώπινων labels — συμπεριλαμβανομένων γνωστών αποτυχιών — πριν οποιοσδήποτε αριθμός που παράγει σημαίνει κάτι.

Η ειλικρινής επιφύλαξη: αυτός ο judge είναι model μισού δισεκατομμυρίου παραμέτρων, και κανείς δεν πρέπει να βαθμολογεί με τέτοιο. Το θέμα δεν είναι ότι οι judges είναι κακοί. Είναι ότι οι αριθμοί παραπάνω κόστισαν οκτώ λεπτά για να παραχθούν, και χωρίς αυτούς η ετυμηγορία αυτού του judge για μια απόφαση shipping θα ήταν 100%.

Αυτό είναι το τρίτο και τελευταίο δηλωμένο Python πάνελ του course, και ο λόγος είναι από πού έρχονται οι δημόσιοι αριθμοί. Το lm-evaluation-harness καλύπτει «πάνω από 60 στάνταρ ακαδημαϊκά benchmarks για LLMs, με εκατοντάδες subtasks και παραλλαγές υλοποιημένες» και είναι «το backend για το δημοφιλές Open LLM Leaderboard του Hugging Face»· τα HELM, SWE-bench και τ-bench είναι Python packages με Python entry points.6 Το να τρέξετε το model σας απέναντι σε έναν δημοσιευμένο αριθμό σημαίνει να τρέξετε τον κώδικά τους, και τη μέρα που θα θέλετε να συγκρίνετε με έναν αριθμό που κάποιος επικαλέστηκε, αυτό είναι το οικοσύστημα στο οποίο βρίσκεστε:

terminalBASH
lm_eval --model hf \
    --model_args pretrained=EleutherAI/gpt-j-6B \
    --tasks hellaswag \
    --device cuda:0 \
    --batch_size 8

Ο δεύτερος λόγος είναι ότι μία μέτρηση σε αυτό το κεφάλαιο είναι αδύνατη μέσω HTTP. Contamination — το test set να έχει διαρρεύσει στα training data — είναι η αστοχία που κάνει ένα δημόσιο benchmark σιωπηρά ανούσιο, και ο πιο αιχμηρός ανιχνευτής γι’ αυτή χρειάζεται το ίδιο το loss του model, που κανένα chat API δεν επιστρέφει. Είναι το cross-entropy ανά token του Κεφαλαίου 8, στραμμένο σε μια ερώτηση για μνήμη:

contamination.pyPYTHON
def nll(text: str) -> float:
    """Mean negative log-likelihood per token, in nats."""
    ids = tok(text, return_tensors="pt").input_ids.to(model.device)
    with torch.no_grad():
        out = model(ids, labels=ids)
    return float(out.loss)

Δέκα ζεύγη προτάσεων: πέντε σε κάθε crawl του web από τότε που υπάρχει, πέντε γραμμένες για αυτό το κεφάλαιο σήμερα το πρωί, καθεμία ζευγαρωμένη με μια αναδιατύπωση που μεταφέρει το ίδιο περιεχόμενο.

setcanonical διατύπωσηαναδιατύπωσηgap
διάσημες, mean of 51.213.03+1.83
φρέσκες, mean of 55.025.96+0.93

Το model εκπλήσσεται τέσσερις φορές περισσότερο από μια πρόταση γραμμένη σήμερα το πρωί απ’ ό,τι από μία που έχει δει ένα εκατομμύριο φορές, και η αναδιατύπωση κοστίζει διπλάσια στις διάσημες — το extra κόστος είναι το μέρος που απομνημονεύτηκε αντί να κατανοηθεί. Το absolute loss συγχέει την απομνημόνευση με τη συνηθισμένη φυσικότητα, άρα το gap είναι το καλύτερο στατιστικό και το continuation test ακόμη καλύτερο. Δώστε του τις πρώτες έξι λέξεις:

TEXT
famous  "Permission is hereby granted, free of"
     -> "charge, to any person obtaining a copy of this software and associated
         documentation files (the "
famous  "All human beings are born free"
     -> "and equal in dignity and rights. The right to life, liberty, and security"
fresh   "All evaluation harnesses are born tiny"
     -> ", and the most common way to measure their size is by using a ruler."

Τρία από τα πέντε διάσημα strings συνεχίστηκαν word-perfect από έξι λέξεις· κανένα από τα πέντε φρέσκα δεν το έκανε. Αυτό είναι ένα model μισού δισεκατομμυρίου παραμέτρων που απαγγέλλει την MIT License. Αν το benchmark σας είναι στο δημόσιο web, θεωρήστε ότι είναι στα weights. Είναι επίσης το επιχείρημα για όλο το κεφάλαιο: ένα golden set που γράψατε από τα δικά σας δεδομένα, κρατημένο έξω από οποιοδήποτε repository διαβάζει crawler, είναι το μόνο test set για το οποίο μπορείτε να είστε βέβαιοι ότι δεν εκπαιδεύτηκε ποτέ πάνω του.

Αξίζει ακόμη να τα διαβάζετε, αρκεί να διαβάζετε τι μετρά το καθένα αντί για τον ενιαίο αριθμό που του έχει κολληθεί.

benchmarkτι μετράένας αριθμός από το paper του
MMLUγνώση multiple-choice σε 57 αντικείμενατο GPT-3 ξεπέρασε την τύχη κατά «σχεδόν 20 ποσοστιαίες μονάδες κατά μέσο όρο»7
HELMπολλά metrics × πολλά scenarios, τυποποιημέναη κάλυψη core scenarios πήγε από 17.9 % σε 96.0 %8
Chatbot Arenacrowdsourced pairwise ανθρώπινη προτίμησηπάνω από 240K ψήφοι· οι ψήφοι του πλήθους σε «καλή συμφωνία» με experts9
SWE-benchεπίλυση πραγματικών GitHub issues, βαθμολογημένη από τα tests του repo2,294 προβλήματα· το καλύτερο model τότε έλυσε «μόλις 1.96 %»10
τ-benchχρήση εργαλείων με simulated user και domain policygpt-4o ≈ 61 % pass^1, ≈ 25 % pass^8 στο retail4
WebArenalong-horizon εργασίες σε λειτουργικά websitesκαλύτερος GPT-4 agent 14.41 % έναντι 78.24 % για ανθρώπους11
OSWorldπραγματικές desktop και OS εργασίες σε εφαρμογές369 εργασίες· καλύτερο model 12.24 %, άνθρωποι 72.36 %12
GAIAερωτήσεις εύκολες για ανθρώπους, δύσκολες για assistants466 ερωτήσεις· άνθρωποι 92 %, GPT-4 με plugins 15 %13
AgentBenchagent reasoning σε 8 διακριτά environmentsμεγάλο χάσμα μεταξύ commercial και open models14
AgentHarmαν ένας agent θα εκτελέσει κακόβουλες multi-step εργασίες110 κακόβουλες εργασίες σε 11 κατηγορίες βλάβης15

Πάρτε τον πίνακα αντί για οποιαδήποτε γραμμή. Τα agentic benchmarks βάζουν όλα τους ανθρώπους πολύ πάνω από τα models, που είναι το αντίθετο των knowledge benchmarks και η καλύτερη σύνοψη μίας γραμμής για το πού βρίσκεται το πεδίο· οι αριθμοί τους παλιώνουν μέσα σε μήνες, άρα να τους παραθέτετε με την ημερομηνία που τους διαβάσατε· και κάθε ένα μετρά μια εργασία που δεν είναι η δική σας.

Το accuracy είναι το metric για το οποίο τσακώνεστε. Αυτά είναι εκείνα που αποφασίζουν αν το πράγμα θα γίνει ship. Και τα τέσσερα βγαίνουν από τα διακόσια runs που έχουν ήδη μετρηθεί.

Κόστος ανά λυμένη εργασία, όχι ανά call. Ο agent κοστίζει $0.001345 ανά προσπάθεια και $0.005172 ανά εργασία που όντως λύθηκε — 3.85 φορές περισσότερο, επειδή τα τρία τέταρτα των προσπαθειών δεν παράγουν τίποτα. Το latency συμπεριφέρεται με τον ίδιο τρόπο: 1,213 ms ανά προσπάθεια, 4,667 ms ανά λυμένη εργασία. Κάθε retry, κάθε re-ask, κάθε εγκαταλειμμένη τροχιά βρίσκεται στον δεύτερο αριθμό και είναι αόρατη στον πρώτο.

Ένα diagnostic που νικά το accuracy. Σε 123 από 200 προσπάθειες ο agent απάντησε χωρίς να καλέσει ούτε ένα εργαλείο — μάντεψε αντί να κοιτάξει. Διαχωρίζοντας πάνω σε αυτό:

TEXT
answered without reading anything   8/123  =  6.5 %  [3.3, 12.3]
answered after reading something   44/77   = 57.1 %  [46.0, 67.6]

Τα διαστήματα δεν πλησιάζουν καν να αγγίξουν. Αυτό αξίζει περισσότερο από το aggregate 26%, επειδή ονομάζει το πράγμα που πρέπει να διορθωθεί — το model δεν αποτυγχάνει να συλλογιστεί, αποτυγχάνει να κοιτάξει — και η διόρθωση είναι στο harness, όχι στο model. Μία επιφύλαξη που αυτό το κεφάλαιο οφείλει στα δικά του standards: οι δύο ομάδες είναι διαφορετικές εργασίες, όχι οι ίδιες paired εργασίες, άρα μέρος αυτού του gap μπορεί να οφείλεται στο ότι παραλείπει τα εργαλεία ακριβώς στις ερωτήσεις που βρίσκει δύσκολες. Ο διαχωρισμός είναι diagnostic, όχι causal claim.

Human intervention rate είναι το metric που ένας αγοραστής ρωτά πρώτα: ποιο ποσοστό των runs σταμάτησε σε approval, guardrail ή handoff. Οι typed interruptions του Κεφαλαίου 23 το κάνουν μετρήσιμο, και μετρημένο ανά τύπο εργασίας και ανά εβδομάδα είναι αυτό που ξεχωρίζει έναν agent που μαθαίνει τη δουλειά του από έναν που αθόρυβα γίνεται ουρά.

Abandonment είναι αυτό που καμία offline suite δεν μπορεί να δει: ο χρήστης που διάβασε την απάντηση, έκλεισε το tab και έκανε την εργασία μόνος του. Η offline αξιολόγηση είναι gate· η production αξιολόγηση είναι συνεχές δείγμα πραγματικής κίνησης, βαθμολογημένο με τον ίδιο grader συν αυτά τα τέσσερα.

Και ένας κανόνας κληρονομημένος από το Κεφάλαιο 17: μην κάνετε ποτέ assert σε exact output. Κάντε assert σε ιδιότητες — valid JSON, σωστό schema, κλήθηκε το σωστό εργαλείο, ένας αριθμός μέσα σε tolerance, ένα required substring παρόν. Η στήλη exact-match στην αρχή αυτού του κεφαλαίου είναι αυτό που συμβαίνει όταν παραβιάζεται αυτός ο κανόνας.

Η αξιολόγηση ενός προμηθευτή δεν αφορά μόνο το accuracy, και αυτό είναι το δεύτερο μισό της ηθικής αυτού του course, με δική του επικεφαλίδα αντί για παράρτημα.

Μετρήστε το bias, μην το υποθέτετε. Ό,τι κι αν πιστεύετε για τη συμπεριφορά ενός model σε ονόματα, διαλέκτους, φύλα ή εθνικότητες, είναι μετρήσιμη ιδιότητα του δικού σας pipeline, και το όργανο είναι αυτό που ήδη έχετε: πάρτε το golden set σας, μεταβάλετε μόνο το attribute, συγκρίνετε paired. Το HELM υπάρχει ακριβώς επειδή αναφερόταν μόνο accuracy εκεί όπου bias, toxicity, calibration και robustness ήταν επίσης αποφασίσιμα.8 Το model card ενός vendor είναι αφετηρία, όχι απόδειξη για τα inputs σας.

Το contamination είναι και ερώτηση προς προμηθευτή. Ο ανιχνευτής παραπάνω είναι ο λόγος να ρωτήσετε πάνω σε τι μετρήθηκε ένας δημοσιευμένος αριθμός, και πότε κόπηκαν τα data του model.

Retention, training και residency, διαβάστηκαν στις 7 Σεπτεμβρίου 2026. Αυτά αλλάζουν, άρα καταγράψτε την ημερομηνία δίπλα στην απάντηση. Η σελίδα πολιτικής της Anthropic δηλώνει: «Από προεπιλογή, δεν θα χρησιμοποιήσουμε τα inputs ή outputs σας από τα εμπορικά προϊόντα μας (π.χ. Claude for Work, Anthropic API, Claude Gov κ.λπ.) για να εκπαιδεύσουμε τα models μας», με εξαίρεση περιεχόμενο που υποβάλλετε ρητά ως feedback, το οποίο αποθηκεύεται «για έως 5 χρόνια».16 Η τεκμηρίωση data controls της OpenAI δηλώνει ότι «data που αποστέλλονται στο OpenAI API δεν χρησιμοποιούνται για training ή βελτίωση των OpenAI models (εκτός αν κάνετε ρητά opt in για να μοιραστείτε data μαζί μας)», περιγράφει προεπιλεγμένο retention τριάντα ημερών για abuse-monitoring logs, και προσφέρει Zero Data Retention, που «εξαιρεί customer content από abuse monitoring logs», συν configurable data residency σε μια λίστα περιοχών.17

Τέσσερις ερωτήσεις να πάρετε γραπτώς πριν από το πρώτο production call, επειδή καθεμία έχει διαφορετικό owner: χρησιμοποιούνται τα data μου για training; για πόσο διατηρούνται και από ποιον; πού επεξεργάζονται και αποθηκεύονται; και τι συμβαίνει σε όλα αυτά αν χρησιμοποιώ reseller, gateway ή aggregator αντί για τον provider απευθείας. Το τελευταίο είναι εκεί όπου ζουν οι περισσότερες εκπλήξεις, και κανένα benchmark δεν θα σας το πει.

Τώρα έχετε το όργανο: ένα golden set που κατέχετε, ένα διάστημα σε κάθε αριθμό, ένα paired test για κάθε σύγκριση, pass^k για τα runs που δεν δείξατε σε κανέναν, έναν measured judge, και έναν ανιχνευτή για το αν ένα δημόσιο score σημαίνει κάτι. Ο τελικός ισχυρισμός του Κεφαλαίου 23 μπορεί τώρα να ελεγχθεί αντί να διατυπωθεί — ένα harness κάνει έναν agent διαχειρίσιμο, όχι σωστό — και ο έλεγχός του πήρε διακόσια runs και οκτώ λεπτά.

Υπάρχει μία ιδιότητα ενός agent που τίποτα από αυτά δεν μετρά, και είναι αυτή που κάνει ανθρώπους να απολύονται.

Κάθε εργασία στο golden set αυτού του κεφαλαίου γράφτηκε από εμένα, και κάθε αρχείο που διάβασε ο agent γράφτηκε από εμένα. Τίποτα σε εκείνον τον κατάλογο δεν προσπαθούσε να κάνει οτιδήποτε. Αλλάξτε μία γραμμή σε ένα αρχείο που έχει οδηγία να διαβάσει ο agent — μια γραμμή που τελειώνει με μια οδηγία προς οτιδήποτε τη διαβάσει στη συνέχεια — και ο agent που σκόραρε 26% θα την ακολουθήσει με τα ίδια εργαλεία, τα ίδια permissions και το ίδιο καθαρό trace, και κάθε αριθμός σε αυτό το κεφάλαιο θα μείνει ακριβώς εκεί όπου είναι. Μια evaluation suite μετρά πόσο συχνά ένα σύστημα φτάνει στον στόχο σας. Δεν μετρά πόσο εύκολα μπορεί κάποιος άλλος να τον αντικαταστήσει με τον δικό του.

Το Κεφάλαιο 30 είναι αυτό: prompt injection, η θανατηφόρα τριάδα private data, untrusted content και external communication, και τι κοστίζει να δώσετε σε έναν agent πραγματικά permissions. Ανοίγει με την παρατήρηση που αυτό το κεφάλαιο απέφευγε — ότι το ίδιο passing score είναι συμβατό με έναν agent που κάνει ακριβώς αυτό που έγραψε ένας attacker σε ένα αρχείο που του είπαν να διαβάσει.


Κάθε αριθμός παραπάνω παρήχθη σε ένα μηχάνημα και κανένας δεν άγγιξε paid endpoint. Ο agent είναι το loop του Κεφαλαίου 23 με δύο από τα τέσσερα εργαλεία του πάνω σε κατάλογο πέντε αρχείων· το model πίσω από το port είναι Qwen/Qwen2.5-0.5B-Instruct, exposed μέσω ενός μικρού server με το ίδιο σχήμα με chat completions endpoint ακριβώς όπως στο Κεφάλαιο 23, αλλά σε half precision σε μία consumer GPU αντί για την CPU εκείνου του κεφαλαίου. Τα κόστη χρησιμοποιούν τις τιμές του Κεφαλαίου 16 — $2.00 ανά εκατομμύριο input tokens και $12.00 ανά εκατομμύριο output — εφαρμοσμένες σε μετρημένα token counts. Τα repeated runs χρησιμοποιούν temperature 0.7 με fixed seeds ώστε να αναπαράγεται όλο το set· ο four-arm πίνακας είναι greedy. Τα διαστήματα είναι Wilson στο 95%, οι paired comparisons είναι two-sided exact sign tests πάνω στα discordant pairs· το Wilson interval είναι του Κεφαλαίου 4 και το exact paired sign test του Κεφαλαίου 15, και τα δύο reused unchanged. Τα ανθρώπινα labels είναι δικά μου, εφαρμοσμένα σε εξήντα απαντήσεις υπό τον γραπτό κανόνα που παρατίθεται στο κείμενο. Διαβάστε κάθε μέγεθος εδώ ως ιδιότητα ενός model μισού δισεκατομμυρίου παραμέτρων και κάθε μέθοδο ως μεταφέρσιμη: ένα μεγαλύτερο model ανεβάζει όλους τους αριθμούς και δεν μετακινεί κανένα από τα όργανα.

  1. OpenAI, A practical guide to building agents (PDF), σελίδα 8, διαβασμένο στις 7 Σεπτεμβρίου 2026. Πηγή της σειράς τριών βημάτων που παρατίθεται παραπάνω και της συνοδευτικής συμβουλής να «build your agent prototype with the most capable model for every task to establish a performance baseline. From there, try swapping in smaller models to see if they still achieve acceptable results.» Τα Κεφάλαια 22 και 25 παραθέτουν τις definitional και orchestration σελίδες του.

  2. Schaeffer, R., Miranda, B. και Koyejo, S. Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004 (2023). Το επιχείρημα ότι discontinuous, all-or-nothing metrics κατασκευάζουν φαινομενικά άλματα από ομαλές underlying βελτιώσεις, με το audit του BIG-Bench που παρατίθεται στο Κεφάλαιο 10. Η δική τους προειδοποίηση αξίζει να επαναληφθεί: τίποτα στο paper δεν ισχυρίζεται ότι μεγάλα models δεν μπορούν να εμφανίσουν emergent abilities.

  3. Kalai, A. T., Nachum, O., Vempala, S. S. και Zhang, E. Why Language Models Hallucinate. arXiv:2509.04664 (2025). Το επιχείρημα ότι benchmarks που βαθμολογούν σωστό-ή-λάθος ανταμείβουν το guessing αντί για abstention, και η προτεινόμενη θεραπεία της «modifying the scoring of existing benchmarks that are misaligned but dominate leaderboards, rather than introducing additional hallucination evaluations». Το Κεφάλαιο 19 το παραθέτει από την πλευρά του retrieval· αυτή είναι η πλευρά evaluation του ίδιου ισχυρισμού.

  4. Yao, S., Shinn, N., Razavi, P. και Narasimhan, K. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. arXiv:2406.12045 (2024). Η προέλευση του pass^k, ορισμένου όπως παρατίθεται παραπάνω, με τους δύο estimators τυπωμένους δίπλα δίπλα στο paper· ο τίτλος του abstract είναι ότι state-of-the-art function-calling agents «succeed on <50 % of the tasks, and are quite inconsistent (pass^8 <25 % in retail)», και η ενότητα 1 δίνει τα στοιχεία gpt-4o περίπου 61% pass^1 και περίπου 25% pass^8 στο τ-retail. Ο estimator pass@k με τον οποίο αντιπαραβάλλεται προέρχεται από Chen, M. et al., Evaluating Large Language Models Trained on Code, arXiv:2107.03374 (2021). 2 3

  5. Zheng, L. et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685 (2023). Πηγή των τριών ονομασμένων biases, του ορισμού της συνέπειας που χρησιμοποιήθηκε παραπάνω («the percentage of cases where a judge gives consistent results when swapping the order of two assistants»), του ευρήματος ότι «only GPT-4 outputs consistent results in more than 60 % of cases» με 65.0% να ανεβαίνει σε 77.5% με few-shot, και του swap-and-require-agreement mitigation που παρατίθεται verbatim. Σημασία έχει και το θετικό του αποτέλεσμα: οι GPT-4 judges φτάνουν «an agreement rate exceeding 80 %» με ανθρώπινες αξιολογήσεις, «the same level of human-human agreement» — που είναι ο λόγος να χρησιμοποιήσετε judge, και ο λόγος να μετρήσετε τον δικό σας. 2 3

  6. EleutherAI, Language Model Evaluation Harness, project README διαβασμένο στις 7 Σεπτεμβρίου 2026: «over 60 standard academic benchmarks for LLMs, with hundreds of subtasks and variants implemented», και «the backend for Hugging Face's popular Open LLM Leaderboard». Η invocation lm_eval που παρατίθεται παραπάνω είναι το δικό του παράδειγμα από το README. Liang, P. et al., Holistic Evaluation of Language Models, arXiv:2211.09110 (2022), είναι ο άλλος στάνταρ runner και η καλύτερη ανάγνωση για evaluation design.

  7. Hendrycks, D., Burns, C., Basart, S., Zou, A., Mazeika, M., Song, D. και Steinhardt, J. Measuring Massive Multitask Language Understanding. arXiv:2009.03300 (2020). 57 εργασίες· ο ισχυρισμός του abstract ότι το μεγαλύτερο GPT-3 model «improves over random chance by almost 20 percentage points on average» είναι χρήσιμη υπενθύμιση του πόσο πρόσφατος είναι ο κορεσμός αυτού του benchmark.

  8. Liang, P. et al. Holistic Evaluation of Language Models. arXiv:2211.09110 (2022). Επτά metrics — accuracy, calibration, robustness, fairness, bias, toxicity και efficiency — σε 16 core scenarios και 30 models, με τα coverage figures που παρατίθενται παραπάνω. Ο λόγος να το διαβάσετε είναι το framing: ποια από τα επτά αναφέρετε είναι από μόνο του επιλογή. 2

  9. Chiang, W.-L. et al. Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132 (2024). Πάνω από 240K ψήφοι τη στιγμή της συγγραφής, crowdsourced pairwise preference, και ο ισχυρισμός ότι «the crowdsourced human votes are in good agreement with those of expert raters».

  10. Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O. και Narasimhan, K. SWE-bench: Can Language Models Resolve Real-World GitHub Issues? arXiv:2310.06770 (2023). 2,294 προβλήματα από 12 Python repositories, βαθμολογημένα από τα tests των ίδιων των repositories, με το καλύτερο model της εποχής να λύνει «a mere 1.96 %». Το Κεφάλαιο 23 το χρησιμοποιεί για την άλλη σημασία της λέξης «harness».

  11. Zhou, S. et al. WebArena: A Realistic Web Environment for Building Autonomous Agents. arXiv:2307.13854 (2023). Λειτουργικά websites σε τέσσερα domains, με καλύτερο GPT-4 agent στο 14.41% έναντι 78.24% για ανθρώπους.

  12. Xie, T. et al. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. arXiv:2404.07972 (2024). 369 εργασίες σε πραγματικά operating systems· άνθρωποι πάνω από 72.36%, καλύτερο model 12.24%, με το GUI grounding να ονομάζεται ως το κύριο gap.

  13. Mialon, G., Fourrier, C., Swift, C., Wolf, T., LeCun, Y. και Scialom, T. GAIA: A Benchmark for General AI Assistants. arXiv:2311.12983 (2023). 466 ερωτήσεις, άνθρωποι στο 92% έναντι 15% για GPT-4 με plugins — η καθαρότερη δημοσιευμένη διατύπωση του χάσματος ανάμεσα σε αυτό που είναι εύκολο για έναν άνθρωπο και αυτό που είναι εύκολο για έναν assistant.

  14. Liu, X. et al. AgentBench: Evaluating LLMs as Agents. arXiv:2308.03688 (2023). Οκτώ διακριτά environments, και σημαντική απόκλιση μεταξύ κορυφαίων commercial models και open-source αντίστοιχου μεγέθους.

  15. Andriushchenko, M. et al. AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents. arXiv:2410.09024 (2024). 110 ρητά κακόβουλες agent tasks (440 με augmentations) σε 11 harm categories, με το εύρημα ότι leading models είναι «surprisingly compliant with malicious agent requests without jailbreaking» και ότι απλά universal jailbreak templates μεταφέρονται σε agents ενώ διατηρούν τις capabilities τους. Είναι η γέφυρα προς το Κεφάλαιο 30: ένα capability benchmark και ένα harm benchmark μετρούν το ίδιο σύστημα και διαφωνούν για το αν είναι έτοιμο.

  16. Anthropic, Is my data used for model training?, privacy.claude.com, διαβασμένο στις 7 Σεπτεμβρίου 2026. Παρατίθεται verbatim παραπάνω, συμπεριλαμβανομένης της εξαίρεσης feedback και του πενταετούς παραθύρου αποθήκευσης για submitted feedback.

  17. OpenAI, Your data (API data controls documentation), developers.openai.com, διαβασμένο στις 7 Σεπτεμβρίου 2026. Πηγή της default no-training δήλωσης, του thirty-day abuse-monitoring retention, της περιγραφής του Zero Data Retention και της λίστας eligible endpoints, και των data residency regions.

Έτοιμοι να αφήσετε τη LIA να επιλέγει;

Δημιουργήστε με κάθε μοντέλο AI σε ένα σημείο — ξεκινήστε δωρεάν σήμερα.