Μετάβαση στο περιεχόμενο
20/30Κεφάλαιο 20 από 30

Fine-Tune, Retrieve ή Prompt; Η απόφαση είναι οικονομική

Η ίδια ερώτηση υποστήριξης απαντάται με τρεις τρόπους και κοστολογείται πλήρως. Το fine-tuning κερδίζει μόνο μετά τα 492 tokens.

Σε αυτή τη σελίδα

Εδώ υπάρχει μία ερώτηση υποστήριξης — ποια είναι η ελάχιστη έκδοση Node που περιμένει αυτό το έργο; — απαντημένη με τέσσερις τρόπους απέναντι στην ίδια τεκμηρίωση και κοστολογημένη από άκρη σε άκρη.

διαδρομήtokens που στάλθηκανκόστος μίας απάντησης
όλη η τεκμηρίωση στο prompt, χωρίς cache43,311$0.066317
όλη η τεκμηρίωση στο prompt, cached43,311$0.007864
τα τέσσερα καλύτερα αποσπάσματα, retrieved1,037$0.002906
ένα fine-tuned model, χωρίς καμία τεκμηρίωση28$0.002088

Το fine-tune είναι το φθηνότερο. Είναι επίσης, για αυτό το πρόβλημα, η λάθος απάντηση — και και τα δύο μπορούν να αποδειχθούν με την ίδια αριθμητική, όχι με άποψη.

Τρεις αριθμοί σε αυτόν τον πίνακα ήδη αντικρούουν τη συμβουλή που θα διαβάσετε παντού. Η ενεργοποίηση του cache εξοικονόμησε 88 % ανά ερώτηση και, στις εκατό ερωτήσεις τον μήνα, κάνει την ίδια διαδρομή πέντε φορές ακριβότερη. Το retrieval στέλνει σαράντα δύο φορές λιγότερα tokens από τη cached prompt διαδρομή και κοστίζει μόνο 2,7 φορές λιγότερο. Και το fine-tuned model, με prompt είκοσι οκτώ tokens, εξοικονομεί μόλις 28 % έναντι του retrieval — επειδή το 97 % όσων πληρώνει είναι η απάντηση, και το training δεν μικραίνει τις απαντήσεις.

Το κεφάλαιο 16 έχτισε μια συνάρτηση κόστους για να διαβάζει ένα τιμολόγιο. Εδώ η ίδια συνάρτηση αποφασίζει μια αρχιτεκτονική.

Εμφάνιση λεπτομερειών

Τι χρειάζεται αυτό το κεφάλαιο από τα προηγούμενα.

  • Το κεφάλαιο 11 έχτισε τα LoRA και QLoRA ως τεχνική: τι είναι ένας low-rank adapter, γιατί εκπαιδεύει τάξεις μεγέθους λιγότερες παραμέτρους. Αυτό το κεφάλαιο δεν το εξηγεί ξανά ποτέ και μόνο το κοστολογεί.
  • Το κεφάλαιο 16 έχτισε το computeCost, τους πέντε χρεώσιμους κουβάδες και τον κανόνα prefix για prompt caching. Το φύλλο κόστους παρακάτω είναι εκείνη η συνάρτηση με τρεις διαδρομές συνδεδεμένες σε αυτήν.
  • Το κεφάλαιο 19 έχτισε τον retriever: chunking με contextual header, hybrid search, τέσσερις θέσεις αποσπασμάτων, citations. Αυτό το κεφάλαιο τον επαναχρησιμοποιεί και μετρά τι κοστίζει να τρέχει, όχι πώς λειτουργεί.

Όλα εδώ είναι TypeScript, επειδή είναι τιμολόγια, αριθμητική και λογιστική, χωρίς tensor στον ορίζοντα — με μία εξαίρεση, δηλωμένη εκεί όπου συμβαίνει: για να μάθουμε τι διδάσκει πραγματικά το fine-tuning, αυτό το κεφάλαιο κάνει fine-tunes σε ένα model, και εκείνο το μέρος είναι Python.

«Πρέπει να κάνουμε fine-tune;» ρωτιέται σαν να ήταν ερώτηση για ένα model. Είναι ερώτηση για έναν προϋπολογισμό, με σχήμα που κανένα benchmark δεν απαντά: τι πληρώνεται μία φορά, τι πληρώνεται ανά ερώτηση και τι πληρώνεται ξανά κάθε φορά που αλλάζει ο κόσμος.

Οι τρεις διαδρομές δεν είναι επίσης τρεις τρόποι να κάνετε ένα πράγμα, και οι vendors το λένε πιο καθαρά από τα περισσότερα blog posts. Ο δικός πίνακας της OpenAI για το πού το supervised fine-tuning είναι καλύτερο απαριθμεί τέσσερις χρήσεις: classification, nuanced translation, παραγωγή περιεχομένου σε συγκεκριμένη μορφή και διόρθωση αποτυχιών instruction-following.1 Καμία από αυτές δεν είναι «να διδάξει στο model κάτι που δεν ξέρει». Η περίληψη του οφέλους είναι ότι «μπορείτε να χρησιμοποιείτε συντομότερα prompts με λιγότερα παραδείγματα και context data, κάτι που εξοικονομεί κόστος token σε κλίμακα και μπορεί να έχει χαμηλότερο latency» — επιχείρημα για το τιμολόγιο, από την εταιρεία που πουλά τη λειτουργία.

Άρα:

  • Το fine-tuning διδάσκει μορφή και συμπεριφορά. Τόνο, format, το σχήμα μιας απάντησης, ένα όριο που μπορείτε να δείξετε αλλά όχι να περιγράψετε. Η ισχυρότερη δημοσιευμένη εκδοχή είναι η Superficial Alignment Hypothesis του LIMA: η γνώση έρχεται από το pretraining, το alignment κυρίως διδάσκει σε ποια υπο-κατανομή formats να μιλά — γι’ αυτό και εκεί αρκούσαν χίλια επιμελημένα παραδείγματα.2
  • Το retrieval παρέχει facts που αλλάζουν. Είναι το μόνο από τα τρία όπου μια αλλαγή στην τεκμηρίωσή σας φτάνει στην απάντηση χωρίς να αγγίξει το model.
  • Το prompting καλύπτει τις περισσότερες πραγματικές περιπτώσεις, και είναι το ειλικρινές baseline. Το in-context learning είναι η προεπιλογή από το Language Models are Few-Shot Learners: η εργασία επιδεικνύεται μέσα στο prompt και κανένα weight δεν μετακινείται.3

Δύο μετρημένες εργασίες κλείνουν την πόρτα στο ενδιάμεσο λάθος. Ο Ovadia και οι συνεργάτες του συνέκριναν την εισαγωγή γνώσης μέσω unsupervised fine-tuning με την εισαγωγή μέσω retrieval, και το retrieval κέρδισε σταθερά, ακόμη και σε facts που το base model είχε ήδη δει στο pretraining.4 Ο Gekhman και οι συνεργάτες του μέτρησαν τη ζημιά: τα παραδείγματα που εισάγουν νέα γνώση fitted αργά, και καθώς το model τελικά τα fits, το hallucination rate του σε άλλες ερωτήσεις αυξάνεται.5 Η διδασκαλία facts μέσω fine-tuning δεν αποτυγχάνει απλώς· υποβαθμίζει απαντήσεις πάνω στις οποίες δεν κάνατε training.

Αυτό το μισό έχει λυθεί. Το οικονομικό μισό όχι, και είναι το υπόλοιπο κεφάλαιο.

Η περίπτωση και η τεκμηρίωση που δεν μένει ακίνητη

Σύνδεσμος στην ενότητα: Η περίπτωση και η τεκμηρίωση που δεν μένει ακίνητη

Μία περίπτωση, τρεγμένη με τρεις τρόπους: τεχνική υποστήριξη πάνω στη δική σας τεκμηρίωση, που αλλάζει κάθε εβδομάδα.

Το corpus είναι πραγματικό και βρίσκεται σε αυτόν τον δίσκο: τα 23 Markdown έγγραφα που ένα ενεργό software repository διατηρεί ως εσωτερική τεκμηρίωση — ο οδηγός build, οι κανόνες brand, το translation brief, δέκα service manuals, οι σημειώσεις performance και security. Μετρημένο με o200k_base, το encoding από το κεφάλαιο 7:

the corpus, measuredTEXT
documents                              23
characters                        159,223
words                              22,194
tokens (o200k_base)                42,921
tokens with per-file headers       43,158

Σαράντα τρεις χιλιάδες tokens είναι ένα άνετο μέγεθος για αυτήν την απόφαση: χωρά σε οποιοδήποτε σύγχρονο window, οπότε και οι τρεις διαδρομές είναι πράγματι διαθέσιμες. Στα δέκα εκατομμύρια η απόφαση έχει ληφθεί για εσάς, και είναι retrieval.

Τώρα η δουλειά που κάνει η λέξη «weekly». Το churn της τεκμηρίωσης συνήθως διατυπώνεται ως ισχυρισμός· εδώ μετριέται, από το version history εκείνου του repository:

μετρημένο στις τελευταίες 26 εβδομάδεςτιμή
commits που αγγίζουν τα 23 έγγραφα40
από αυτά, edits σε έγγραφο που ήδη υπήρχε21
διακριτές ημερολογιακές εβδομάδες με τουλάχιστον μία αλλαγή11
commits που αγγίζουν τον user-facing κατάλογο κειμένων του προϊόντος στις 8 εβδομάδες ζωής του157
ημερολογιακές εβδομάδες από αυτές τις 8 στις οποίες άλλαξε8

Τα έγγραφα κινούνται περίπου κάθε δεύτερη εβδομάδα. Τα user-visible strings — που είναι αυτό για το οποίο ρωτιέται πραγματικά ένα support desk — κινήθηκαν κάθε εβδομάδα που υπήρχαν, περίπου είκοσι commits την εβδομάδα. Όποια διαδρομή διαλέξουμε πρέπει να επιβιώσει από αυτό, και το «πόσο συχνά αλλάζει το πράγμα πάνω στο οποίο κάνατε training;» αποδεικνύεται ότι έχει έναν αριθμό στο δικό σας repository, όχι μια άποψη.

Είκοσι ρεαλιστικές ερωτήσεις υποστήριξης γράφτηκαν απέναντι σε αυτό το corpus, μία ανά θέμα, και κάθε αριθμός παρακάτω υπολογίζεται πάνω σε αυτές τις είκοσι.

Το πιο απλό πράγμα που δουλεύει: βάλτε όλο το corpus στο system prompt, την ερώτηση στο τέλος, και αφήστε το model να τη βρει.

one call, route oneTEXT
system instructions                       140 tokens
the 23 documents                       43,158 tokens
the question (median of 20 measured)       13 tokens
the answer (the one assumption)           150 tokens

Κάθε αριθμός εκεί μετρήθηκε εκτός από τον τελευταίο: 150 output tokens είναι μια υπόθεση, επιλεγμένη μέσα στο εύρος των assistant turns που χρέωσε το κεφάλαιο 16. Είναι ο μόνος αριθμός εδώ που δεν εκτελέστηκε, εφαρμόζεται ταυτόσημα και στις τρεις διαδρομές, και η ενότητα break-even δείχνει ακριβώς πόσο μετακινείται το συμπέρασμα όταν τον αλλάζετε.

Με τις τιμές που διαβάστηκαν από τη σελίδα του provider στις 7 Σεπτεμβρίου 2026 — $1.50 ανά εκατομμύριο input tokens, $9.00 ανά εκατομμύριο output6 — αυτό είναι $0.066317 ανά ερώτηση. Πληρώνετε για να ξαναδιαβάσετε σαράντα τρεις χιλιάδες tokens ώστε να απαντήσετε δεκατρία.

Η διόρθωση του κεφαλαίου 16 εφαρμόζεται άμεσα: το corpus είναι σταθερό και βρίσκεται μπροστά, άρα είναι τέλειο cache prefix, και η ανάγνωσή του πίσω κοστίζει το ένα δέκατο — $0.007864 ανά ερώτηση, μείωση 88 %. Ισχύει και η προειδοποίηση του κεφαλαίου 16, με τη μορφή που εκείνο το κεφάλαιο επισήμανε αλλά δεν κοστολόγησε. Αυτός ο provider δεν χρεώνει write premium· χρεώνει ενοίκιο. Ένα explicit cache κοστίζει $0.000001 ανά stored token ανά ώρα,6 άρα το να κρατάτε 43,298 tokens ζεστά κοστίζει

43,298×$0.000001=$0.043298 per hour43{,}298 \times \$0.000001 = \$0.043298 \ \text{per hour}

είτε ρωτάει κάποιος κάτι είτε όχι. Αυτό είναι $189.78 σε έξι μήνες, για ένα άδειο δωμάτιο. Διαιρέστε το ενοίκιο με την εξοικονόμηση ανά ερώτηση και η συνθήκη βγαίνει σε μία γραμμή: το caching αυτού του corpus αποσβένεται πάνω από 0.74 ερωτήσεις την ώρα — 546 τον μήνα όταν συνυπολογιστεί και το εβδομαδιαίο cache rebuild. Κάτω από αυτό, η λειτουργία που ενεργοποιήσατε για να εξοικονομήσετε χρήματα τα χάνει.

έξι μήνες, 100 ερωτήσεις τον μήνασύνολο
όλο το corpus, χωρίς cache$39.79
όλο το corpus, cached$196.18

Ίδια διαδρομή, ίδιος κώδικας, ένα flag, πέντε φορές ο λογαριασμός. Το κεφάλαιο 16 βρήκε μια εκδοχή αυτού που προκαλούνταν από ένα timestamp στη λάθος θέση· εδώ τίποτα δεν είναι λάθος εκτός από το traffic. Το cache είναι στοίχημα στον όγκο, και σε αυτόν τον provider το βάζετε με την ώρα.

Ο retriever του κεφαλαίου 19, αμετάβλητος: κόψτε σε όρια ενοτήτων με contextual header, κάντε index, βάλτε τα τέσσερα καλύτερα αποσπάσματα στο prompt. Μετρημένο πάνω στις είκοσι ερωτήσεις:

the retrieval route, measuredTEXT
chunks produced from the corpus              330
mean tokens of a chunk's own text          124.9
mean tokens of the four retrieved extracts   884
prompt per question (140 + 884 + 13)       1,037
one-off embedding of every chunk        46,823 tokens

Σαράντα δύο φορές λιγότερα prompt tokens από τη διαδρομή ένα, με $0.002906 ανά ερώτηση. Το index κοστίζει $0.0070 για να χτιστεί στα $0.15 ανά εκατομμύριο embedding tokens6 — λιγότερο από την αξία τριών ερωτήσεων — και τα ίδια $0.0070 για να ξαναχτιστεί από την αρχή κάθε φορά που αλλάζει η τεκμηρίωση. Το rebuild ολόκληρου του index κάθε εβδομάδα για έξι μήνες κοστίζει δεκαοκτώ σεντς.

Αξίζει να σταθούμε σε ένα πράγμα. Το retrieval καταστρέφει το prompt caching. Το σταθερό prefix είναι τώρα η system instruction των 140 token· από το token 141 το prompt διαφέρει σε κάθε κλήση, επειδή τα αποσπάσματα επιλέγονται ανά ερώτηση. Και τα 140 tokens είναι κάτω από κάθε ελάχιστο cache που παρέθεσε το κεφάλαιο 16. Άρα η διαδρομή δύο δεν μπορεί να γίνει cached καθόλου, κάτι που ακούγεται κακό και δεν είναι: το να μην κάνετε caching σε 1,037 tokens είναι φθηνότερο από το να κάνετε caching σε 43,298.

Αυτός είναι ένας γενικός κανόνας που αξίζει να κρατήσετε: οι δύο μεγάλες τεχνικές εξοικονόμησης token είναι αμοιβαία αποκλειόμενες στο ίδιο περιεχόμενο, και κερδίζει όποια αφαιρεί περισσότερα tokens. Το retrieval αφαιρεί το 97.6 % αυτών.

Διαδρομή τρία: σταματήστε να στέλνετε την τεκμηρίωση

Σύνδεσμος στην ενότητα: Διαδρομή τρία: σταματήστε να στέλνετε την τεκμηρίωση

Κάντε training σε διακόσια παραδείγματα στο house style και μετά κάντε ερωτήσεις χωρίς καμία τεκμηρίωση συνημμένη.

the fine-tuned route, measuredTEXT
training examples                            200
training tokens                           24,389
epochs                                         3
prompt per question (15 + 13)                 28

Το training κοστίζει 24,389 × 3 × $10.00 ανά εκατομμύριο = $0.7317. Αυτό είναι ολόκληρο το κόστος κατασκευής, λιγότερο από έναν καφέ, και ακριβώς γι’ αυτό τόσες ομάδες το πληρώνουν πριν ελέγξουν αν βοηθά.

Τώρα η παγίδα, και είναι ο λόγος που υπάρχει αυτό το κεφάλαιο. Ένα fine-tuned model δεν κοστίζει το ίδιο με το base model του για να τρέξει. Η σελίδα τιμολόγησης το λέει σε μία πρόταση: «for model inference starting from Gemini 3, tuned model endpoint prediction price will be 1.5 times of the base model6 Όχι το training. Το inference, σε κάθε token, για όσο ζει το model.

Άρα βάλτε το σε έναν τύπο. Έστω pip_i και pop_o οι base τιμές input και output, mm ο tuned πολλαπλασιαστής, LRL_R το μήκος prompt της διαδρομής που αντικαθιστάτε, LFL_F το μήκος prompt μετά το fine-tuning, και OO το μήκος απάντησης. Το fine-tuning είναι φθηνότερο ανά ερώτηση μόνο όταν

LR  >  mLF  +  (m1)OpopiL_R \;>\; m\,L_F \;+\; \frac{(m-1)\,O\,p_o}{p_i}

Ο πρώτος όρος είναι προφανής: το νέο σύντομο prompt σας, με markup. Ο δεύτερος δεν είναι, και εκεί πηγαίνουν τα χρήματα — η προσαύξηση στην απάντηση, που δεν έχει καμία σχέση με το prompt σας και που το training δεν μπορεί να μικρύνει. Με τους μετρημένους αριθμούς — m=1.5m = 1.5, LF=28L_F = 28, O=150O = 150, po/pi=6p_o/p_i = 6 — το threshold είναι

the break-even prompt lengthTEXT
answer   50 tokens -> the prompt it replaces must exceed   192 tokens
answer  150 tokens -> the prompt it replaces must exceed   492 tokens
answer  400 tokens -> the prompt it replaces must exceed 1,242 tokens
answer 1000 tokens -> the prompt it replaces must exceed 3,042 tokens

Στο μετρημένο μήκος απάντησης, 492 tokens — από τα οποία 450 είναι η προσαύξηση απάντησης, όχι το prompt. Η αντικατάσταση ενός συντομότερου prompt από αυτό είναι ακριβότερη ανά ερώτηση, για πάντα, σε οποιονδήποτε όγκο· και το threshold αυξάνεται γραμμικά με το πόσα λέει ο assistant σας, οπότε ένας που γράφει μεγάλες απαντήσεις δεν μπορεί ποτέ να fine-tune τον δρόμο του προς φθηνότερο token, όσο prompt κι αν διαγράψει.

Το ίδιο γεγονός από την άλλη άκρη είναι η πρόταση που πρέπει να θυμάστε. Από τα $0.002088 ανά ερώτηση της fine-tuned διαδρομής, το 97.0 % είναι η απάντηση. Το fine-tuning βελτιστοποιεί το υπόλοιπο τρία τοις εκατό.

Τέσσερις αριθμοί περιγράφουν οποιαδήποτε από αυτές τις διαδρομές: τι πληρώνετε μία φορά, τι πληρώνετε όταν αλλάζει η τεκμηρίωση, τι πληρώνετε ανά ώρα ανεξάρτητα από τη χρήση, και τι πληρώνετε ανά ερώτηση. Αυτό επεκτείνει το computeCost του κεφαλαίου 16 χωρίς να το τροποποιεί.

costsheet.tsTS
import { computeCost, type Pricing, type Usage } from "./cost";   // Chapter 16

export interface Route {
  name: string;
  setupUSD: number;            // paid once, before the first question
  perRefreshUSD: number;       // paid every time the documentation changes
  standingUSDPerHour: number;  // paid per hour whatever the traffic
  pricing: Pricing;
  usage: Usage;                // one question and its answer
}

export const perQueryUSD = (r: Route) => computeCost(r.pricing, r.usage);

const HOURS_PER_MONTH = (24 * 365.25) / 12;

export function totalUSD(
  r: Route, months: number, queriesPerMonth: number, refreshesPerMonth: number,
) {
  return r.setupUSD
       + months * refreshesPerMonth * r.perRefreshUSD
       + months * HOURS_PER_MONTH * r.standingUSDPerHour
       + months * queriesPerMonth * perQueryUSD(r);
}

/** Monthly volume at which `b` overtakes `a`. null = it never does. */
export function crossover(
  a: Route, b: Route, months: number, refreshesPerMonth: number,
): number | null {
  const fixed = (r: Route) =>
      r.setupUSD
    + months * refreshesPerMonth * r.perRefreshUSD
    + months * HOURS_PER_MONTH * r.standingUSDPerHour;
  const dFixed = fixed(b) - fixed(a);                     // b's extra fixed cost
  const dVar = perQueryUSD(a) - perQueryUSD(b);           // b's per-question saving
  if (dVar <= 0) return null;                             // b is never cheaper
  return Math.max(0, dFixed / dVar / months);
}

Το tuned model δεν είναι διαφορετικός τιμοκατάλογος, είναι ο ίδιος πολλαπλασιασμένος:

the tuned endpoint is the base list times 1.5TS
const TUNED_MULTIPLIER = 1.5;   // read from the provider's pricing page, 2026-09-07

const scale = (p: Pricing, k: number): Pricing => ({
  input: p.input.map(t => ({ ...t, price: t.price * k })),
  cachedInput: p.cachedInput!.map(t => ({ ...t, price: t.price * k })),
  output: p.output.map(t => ({ ...t, price: t.price * k })),   
});

Εκείνη η μία επισημασμένη γραμμή είναι όλο το επιχείρημα της προηγούμενης ενότητας γραμμένο ως κώδικας: ο πολλαπλασιαστής προσγειώνεται και στο output.

Έξι μήνες, με την τεκμηρίωση να ανανεώνεται εβδομαδιαία:

ερωτήσεις / μήναprompt, cachedprompt, χωρίς cacheretrievalfine-tune
100$196.18$39.79$1.93$21.01
1,000$238.65$397.90$17.62$32.28
10,000$663.32$3,978.99$174.52$145.04
100,000$4,909.98$39,789.90$1,743.49$1,272.56

Και τα crossovers, που είναι οι τέσσερις αριθμοί που χρειάζεται πραγματικά ένας προϋπολογισμός:

crossovers, six monthsTEXT
retrieval -> fine-tune, documentation never changes:     148 questions / month
retrieval -> fine-tune, documentation refreshed weekly: 3,989 questions / month
prompt (no cache) -> retrieval:                            1 question / month
prompt (no cache) -> prompt (cached):                    546 questions / month

Διαβάστε τα δύο πρώτα μαζί, επειδή είναι το σημείο του κεφαλαίου. Ένα ακίνητο corpus κάνει το fine-tuning να αποσβένεται σε εκατόν πενήντα ερωτήσεις· ένα corpus που αλλάζει εβδομαδιαία μετακινεί το ίδιο crossover κατά παράγοντα είκοσι επτά, και τίποτα στο model δεν άλλαξε — μόνο το πόσο συχνά το πληρώνετε ξανά. Το κόστος κατασκευής είναι υποσημείωση· το κόστος συντήρησης είναι η απόφαση.

Αν τώρα συμπεράνετε ότι ένα busy support desk πρέπει να κάνει fine-tune, η αριθμητική συμφωνεί μαζί σας. Παραμένει λάθος, και η επόμενη ενότητα εξηγεί γιατί.

Το φύλλο κόστους έχει μία στήλη που δεν μπορεί να υπολογίσει, οπότε αυτή η ενότητα τρέχει το fine-tune: τοπικά, σε ένα μικρό open model, με τον adapter γραμμένο στο χέρι αντί να τραβηχτεί από library. Το κεφάλαιο 11 έχτισε LoRA· εδώ είναι, στα q_proj και v_proj όλων των 24 layers του Qwen2.5-0.5B-Instruct σε rank 8:

lora.py — the whole adapterPYTHON
class LoRALinear(nn.Module):
    def __init__(self, base: nn.Linear, r=8, alpha=16):
        super().__init__(); self.base = base
        for p in self.base.parameters():
            p.requires_grad = False              # the model is frozen  
        self.A = nn.Parameter(torch.zeros(r, base.in_features))
        nn.init.normal_(self.A, std=1 / r)
        self.B = nn.Parameter(torch.zeros(base.out_features, r))
        self.s = alpha / r
        self.on = True                           # so the same run can compare both

    def forward(self, x):
        y = self.base(x)
        return y + (x @ self.A.T @ self.B.T) * self.s if self.on else y

Τα διακόσια training examples έρχονται μηχανικά από το corpus, άρα αναπαράγονται: η ερώτηση είναι μια επικεφαλίδα ενότητας μετατρεμμένη σε ερώτηση, η απάντηση είναι το ίδιο το κείμενο εκείνης της ενότητας σε άκαμπτο house style — μία γραμμή που αρχίζει με Short answer:, μία γραμμή που αρχίζει με Source: με το file path. Το format είναι η μορφή που διδάσκεται· το path είναι το fact. Έπειτα δύο αριθμοί πάνω σε είκοσι held-out ερωτήσεις: βγαίνει η απάντηση στο house style, και ονομάζει το αρχείο που πραγματικά απαντά στην ερώτηση;

Δύο baselines κάνουν τον πίνακα αναγνώσιμο, και και τα δύο είναι η επιμονή του κεφαλαίου 4, όχι εκ των υστέρων σκέψη. Δέκα από τις είκοσι σωστές απαντήσεις είναι το ίδιο αρχείο, άρα ένα model που αγνοεί την ερώτηση και πάντα απαντά CLAUDE.md σκοράρει 10/20. Και ο retriever έχει το δικό του ceiling: σε αυτές τις είκοσι ερωτήσεις τα τέσσερα αποσπάσματά του περιέχουν το σωστό αρχείο 14 φορές και το κατατάσσουν πρώτο 7, άρα 14/20 είναι το μέγιστο που θα μπορούσε να σκοράρει οποιοσδήποτε reader χρησιμοποιώντας τον.

measuredTEXT
LoRA modules 48   trainable parameters 540,672 (0.109 % of the model)
400 steps, 2 epochs, 0.76 s/step on 16 CPU threads, 304 s in total
mean loss over the first 50 steps 3.7363 -> over the last 50 steps 2.4197

                                        house style   correct source
always answer the most common file             --          10 / 20
the retriever's own ceiling                    --          14 / 20
base model, closed book                    0 / 20           0 / 20
fine-tuned, closed book                   19 / 20           8 / 20
base model, four retrieved extracts       13 / 20           2 / 20
fine-tuned, four retrieved extracts        1 / 20           1 / 20

Η μορφή μαθεύτηκε, πλήρως και γρήγορα. Από μηδέν σε δεκαεννέα στα είκοσι, από έναν adapter 540,672 παραμέτρων — 0.109 % του model — σε πέντε λεπτά training σε επεξεργαστή χωρίς κάρτα γραφικών στον ορίζοντα.

Τα facts όχι. Οκτώ στα είκοσι δεν διακρίνεται από τα δέκα που παίρνετε αγνοώντας εντελώς την ερώτηση, και το interval του κεφαλαίου 4 σε είκοσι δείγματα το λέει δυνατά. Εκείνα τα file paths ήταν στα training data τρεις φορές· αυτό που βγήκε ήταν η συνήθεια να τελειώνει με μια plausible-looking γραμμή Source:. Στην ερώτηση στην αρχή αυτού του κεφαλαίου, το fine-tuned model απάντησε Short answer: 10.x . . . και cited CLAUDE.md. Η σωστή απάντηση, που βρίσκεται στο CLAUDE.md, είναι 18.17.0.

Και μετά η μορφή έσπασε, που είναι η σειρά που δικαιολογεί το πείραμα. Δώστε στο fine-tuned model χίλια tokens retrieved αποσπασμάτων — ένα σχήμα prompt που δεν είχε δει ποτέ, αφού κάθε training prompt ήταν είκοσι οκτώ tokens — και το house style καταρρέει από 19/20 σε 1/20. Στην ερώτηση στην αρχή αυτού του κεφαλαίου απαντά 18.17.0 — σωστά, και χωρίς κανένα από τα format για τα οποία εκπαιδεύτηκε. Άρα το fine-tuning δεν δίδαξε ένα format· δίδαξε ένα format υπό την προϋπόθεση των prompts στο training set, και το πρώτο prompt που έμοιαζε διαφορετικό πήρε μαζί του το format. Ό,τι κάνετε fine-tune γίνεται η μία input distribution στην οποία το model σας είναι καλό, και κανείς δεν το βάζει αυτό στο spreadsheet.

Μια τελευταία σημείωση για το metric, που δείχνει κατευθείαν στο κεφάλαιο 29: το «correct source» σκοράρει μορφή και fact μαζί, γι’ αυτό και οι δύο retrieval σειρές φαίνονται άθλιες παρότι και τα δύο models πέτυχαν σωστά το fact εκείνης της ερώτησης. Ένας end-to-end αριθμός έκρυβε τρία πράγματα — έναν retriever με 14/20 recall, έναν 0.5B reader και ένα citation format — και το να επιλέξετε τι να διορθώσετε σημαίνει να τα χωρίσετε πριν μετρήσετε, όχι μετά.

Τώρα η στήλη που συμπληρώνουν για εσάς οι vendors. Ένα fine-tuned model δεν είναι asset που κατέχετε· είναι μίσθωση πάνω στο base model κάποιου άλλου, με ημερομηνία λήξης τυπωμένη πάνω της. Στις 7 Σεπτεμβρίου 2026 η ενότητα fine-tuning της σελίδας τιμολόγησης της OpenAI είχε αυτή την ειδοποίηση αυτούσια:

OpenAI is winding down the fine-tuning platform. The platform is no longer accessible to new users, but existing users of the fine-tuning platform will be able to create training jobs for the coming months. All fine-tuned models will remain available for inference until their base models are deprecated.7

Το timeline είναι χρονολογημένο μέχρι ημέρας: 7 Μαΐου 2026, κλειστό για οργανισμούς που δεν είχαν κάνει ποτέ fine-tune· 2 Ιουλίου 2026, κλειστό για όσους δεν είχαν τρέξει inference σε fine-tuned model σε εξήντα ημέρες· 6 Ιανουαρίου 2027, καθόλου νέα jobs.8 Η ίδια σελίδα προγραμματίζει το shutdown των ίδιων των fine-tuned models — ft-gpt-3.5-turbo, ft-gpt-4, ft-gpt-4.1-nano, ft-babbage-002, ft-davinci-002 — στις 23 Οκτωβρίου 2026, το καθένα με ένα recommended replacement base model, που είναι ένας ευγενικός τρόπος να πει: εκπαιδεύστε το ξανά.

Ο άλλος frontier vendor δεν σας πούλησε ποτέ τη μίσθωση. Το documentation index της Anthropic απαριθμεί 699 σελίδες και ούτε μία δεν αφορά fine-tuning· οι ενότητες model-customisation της σελίδας τιμολόγησης του Bedrock καλύπτουν Amazon Nova, Amazon Titan, Cohere, Meta και OpenAI open-weight models, και κανένα Claude.910 Αν η αρχιτεκτονική σας εξαρτάται από ένα fine-tune, μία από τις τρεις frontier οικογένειες είναι απλώς μη διαθέσιμη για εσάς σε οποιονδήποτε προϋπολογισμό.

Το self-hosting αντικαθιστά τη μίσθωση ενός model με τη μίσθωση ενός μηχανήματος, και η AWS κάνει αυτή την αριθμητική στη δική της σελίδα: μία model unit provisioned throughput για customized model, δέσμευση ενός μήνα, είναι «1 model unit × $21.18 × 24 hours × 31 days = $15,757.92» τον μήνα.10 Η απευθείας ενοικίαση του μετάλλου είναι φθηνότερη και όχι δωρεάν — $3.99 ανά GPU-hour on demand για H100, $1.99 preemptible11 — περίπου $2,900 τον μήνα για μία κάρτα που πρέπει να είναι ενεργή είτε ρωτάει κάποιος κάτι είτε όχι. Ολόκληρη η retrieval διαδρομή στις δέκα χιλιάδες ερωτήσεις τον μήνα είναι $174.52 για έξι μήνες.

Εδώ το LoRA κερδίζει τη θέση του, ως επιχείρημα προϋπολογισμού και όχι τεχνικό. Μετρημένο στο ίδιο model, ένας rank-16 adapter πάνω σε attention και τα feed-forward layers είναι 8,798,208 παράμετροι — 1.781 % του model, 17.6 MB σε bfloat16 — έναντι 0.988 GB base weights, και η optimiser και gradient state του είναι 140.77 MB εκεί όπου το πλήρες fine-tuning χρειάζεται 7.90 GB, παράγοντας 56. Η συνέπεια δεν είναι φθηνότερο training αλλά ότι ένα loaded base model μπορεί να εξυπηρετεί πολλούς adapters, που είναι ο μόνος τρόπος το σταθερό κόστος μιας GPU να διαιρεθεί με οτιδήποτε. Το managed training το αντικατοπτρίζει: $0.48 ανά εκατομμύριο tokens low-rank έως 16B έναντι $0.54 full, με ελάχιστο $4.00 ανά job.11 Αυτό το floor είναι η λεπτομέρεια. Στα 24,389 tokens για τρία epochs, κάθε retraining σε αυτό το corpus χρεώνει $4.00 αντί για τα $0.04 στα οποία υπολογίζεται — $104 ελάχιστων χρεώσεων σε είκοσι έξι εβδομαδιαία runs, για ενενήντα ένα σεντς αριθμητικής.

Τι κοστίζει η ιδιωτικότητα και γιατί το distillation δεν είναι τέταρτη επιλογή

Σύνδεσμος στην ενότητα: Τι κοστίζει η ιδιωτικότητα και γιατί το distillation δεν είναι τέταρτη επιλογή

Δύο ακόμη στήλες που εμφανίζονται μόνο στο τιμολόγιο.

Το data residency κοστίζει περίπου δέκα τοις εκατό, και δύο providers συμφωνούν στον αριθμό. Η OpenAI χρεώνει «a 10 % uplift» σε data-residency endpoints για models που κυκλοφόρησαν στις ή μετά τις 5 Μαρτίου 2026·7 η Vertex τιμολογεί τα non-global endpoints της στα $1.65 έναντι $1.50, το ίδιο δέκα τοις εκατό.6 Βάλτε το απέναντι στο πενήντα τοις εκατό που κοστίζει ένα tuned endpoint και η λαϊκή σοφία αντιστρέφεται: το residency είναι φθηνό και το fine-tuning όχι — και το fine-tuning δεν είναι έτσι κι αλλιώς η private επιλογή, αφού το corpus φτάνει στον provider είτε έτσι είτε αλλιώς, μία φορά στο training time αντί για μία φορά ανά call.

Η πιο ρητή τιμή που μπήκε ποτέ στα δεδομένα σας βρίσκεται στην ίδια σελίδα, η οποία απαριθμεί ένα fine-tuned model δύο φορές: με ενεργοποιημένο data sharing, το inference είναι ακριβώς μισό — $2.00 έναντι $4.00 input, $8.00 έναντι $16.00 output.7 Το να αφήσετε τον provider να κρατήσει όσα στείλατε αξίζει έκπτωση 50 %, που σας λέει τι αξίζει σε εκείνον.

Το distillation — training ενός μικρού δικού σας model στις απαντήσεις ενός μεγάλου — συνήθως προσφέρεται ως διέξοδος και από τα δύο. Κοστολογήστε το και δεν είναι, επειδή ο teacher είναι το σύστημα που προσπαθούσατε να αντικαταστήσετε: η παραγωγή διακοσίων training examples ρωτώντας τη retrieval διαδρομή διακόσιες ερωτήσεις κοστίζει 200 × $0.002906 = $0.58, πάνω από τα $0.73 για training πάνω τους. Το distillation είναι κάτι που κάνετε αφού δουλέψει το retrieval pipeline, για να το κάνετε φθηνότερο, και κληρονομεί κάθε fact που ο retriever πήρε λάθος.

Τα χρήματα είναι το ορατό μισό. Το άλλο φτάνει ως αναμονή, με την ίδια αιτία με τον λογαριασμό: το model διαβάζει ολόκληρο το prompt πριν πει λέξη. Το κεφάλαιο 13 μέτρησε prefill έναντι decode σε ένα model που μπορούσατε να αγγίξετε· εδώ είναι η ίδια μέτρηση, ένα run, ένα μηχάνημα, απέναντι στο μήκος prompt:

prompt tokensχρόνος μέχρι το πρώτο tokenανά token
28312 ms11.14 ms
1,0374,971 ms4.79 ms
4,09622,272 ms5.44 ms
8,19249,443 ms6.04 ms

Οι απόλυτοι αριθμοί ανήκουν σε ένα 0.5B model πάνω σε δεκαέξι CPU threads και δεν λένε τίποτα για hosted frontier model. Το σχήμα μεταφέρεται ακριβώς: το prefill μεγαλώνει με το μήκος prompt, και το κόστος ανά token ανεβαίνει καθώς αρχίζει να φαίνεται ο quadratic όρος του κεφαλαίου 9 — 4.79 ms στα χίλια tokens έναντι 6.04 ms στις οκτώ χιλιάδες, ποινή 26 % απλώς επειδή είναι μεγαλύτερο.

Η συνέπεια για τις τρεις διαδρομές είναι άμεση. Η διαδρομή ένα prefills σαράντα τρεις χιλιάδες tokens ανά ερώτηση, και ένα cache hit είναι αυτό που το κάνει ανεκτό — το κεφάλαιο 16 εξήγησε γιατί: ένα cache read αντικαθιστά prefill work, άρα αγοράζει latency και χρήματα σε μία συναλλαγή. Η διαδρομή δύο prefills χίλια και προσθέτει πρώτα ένα round trip στο index. Η διαδρομή τρία prefills είκοσι οκτώ και δεν προσθέτει τίποτα, κάτι που τη κάνει μετρήσιμα την ταχύτερη από τις τρεις στην απάντηση. Απλώς απαντά το λάθος πράγμα.

Εκεί όπου καμία από τις τρεις δεν είναι η απάντηση

Σύνδεσμος στην ενότητα: Εκεί όπου καμία από τις τρεις δεν είναι η απάντηση

Τρεις αποτυχίες που μοιάζουν με προβλήματα model και δεν είναι — δέκα λεπτά εδώ γλιτώνουν έναν μήνα αργότερα:

Το retrieval δεν μπορεί να retrieve κάτι που κανείς δεν έγραψε, και το fine-tuning πάνω του απλώς διδάσκει στο model να ακούγεται σίγουρο. Αν η κορυφαία ερώτηση υποστήριξής σας δεν απαντάται πουθενά στο corpus, η λύση είναι ένας technical writer.

«Πού είναι η παραγγελία μου;» είναι database query, όχι ερώτηση γνώσης. Αυτό είναι tool call — κεφάλαιο 18 — και ούτε το training ούτε το retrieval το αντικαθιστούν.

Όταν δύο προϊόντα μοιράζονται ένα όνομα, η καλύτερη δυνατή απάντηση είναι αίτημα για διευκρίνιση. Αυτό είναι product decision για το input, όχι modelling decision για το output.

Και η απαίτηση πάνω από όλα αυτά: αυτή η απόφαση δεν μπορεί να ληφθεί χωρίς evaluation set, και ο vendor που πουλά το fine-tune το λέει. Ο οδηγός της OpenAI ανοίγει με «Only invest in fine-tuning after setting up evals. You need a reliable way to determine whether your fine-tuned model is performing better than a base model», και προσθέτει ότι αν πενήντα καλά παραδείγματα δεν αλλάζουν τίποτα, το πρόβλημα είναι η εργασία ή το prompt, όχι ο όγκος δεδομένων.1 Είκοσι ερωτήσεις, που είναι αυτό που χρησιμοποίησε αυτό το κεφάλαιο, δείχνουν έναν μηχανισμό και δεν μπορούν να επιλέξουν προμηθευτή — το κεφάλαιο 4 μέτρησε γιατί, και το τι να κάνετε όταν είκοσι cases είναι όλα όσα έχετε — επαναλάβετε τα, ζευγαρώστε τα, και μετρήστε τη διασπορά μεταξύ runs — είναι το κεφάλαιο 29.

Τέσσερις στήλες, και μόνο η τελευταία αποφασίζει:

promptretrievalfine-tune
τι διδάσκειοτιδήποτε μπορείτε να γράψετεfacts που αλλάζουνμορφή και συμπεριφορά
κόστος κατασκευήςμηδέν$0.0070 συν ένα απόγευμα$0.7317 συν ένα eval set
κόστος ανά ερώτηση$0.0079 cached, $0.0663 όχι$0.0029$0.0021, πάνω από 492 prompt tokens
κόστος συντήρησηςμηδέν, ή $0.043 την ώρα σε ενοίκιο$0.0070 ανά rebuildένα retraining ανά αλλαγή, συν ένα ανά base model που αποσύρεται

Ο κανόνας που προκύπτει, και είναι αρκετά σύντομος για να τον κρατήσετε: ξεκινήστε με το prompt· προσθέστε retrieval όταν τα facts κινούνται· κάντε fine-tune μόνο όταν έχετε μετρήσει ότι αυτό που ακόμη σας λείπει είναι σχήμα, όχι fact — και κοστολογήστε την απάντηση, όχι το prompt, πριν το κάνετε.

Η άβολη εκδοχή, για όποιον ήρθε έχοντας ήδη αποφασίσει: στη μετρημένη περίπτωση αυτού του κεφαλαίου το fine-tuning είναι η φθηνότερη διαδρομή πάνω από τέσσερις χιλιάδες ερωτήσεις τον μήνα, και στα facts ακόμη δεν μπορεί να κερδίσει το να απαντά CLAUDE.md σε όλα.

Κάθε τιμή εδώ ήταν ανά token, και κάθε διαδρομή ένας διαφορετικός τρόπος διάταξης tokens. Αυτό πρόκειται να πάψει να ισχύει.

Το κεφάλαιο 21 αφήνει το κείμενο. Μια εικόνα που μπαίνει σε model δεν είναι string αλλά πλέγμα patches με token count που δεν επιλέξατε· ένα προφορικό λεπτό χρεώνεται ανά δευτερόλεπτο σε έναν provider και ανά audio token σε άλλον· η synthetic speech πωλείται ανά χαρακτήρα, η transcription ανά λεπτό, το raw compute ανά GPU-second. Η ερώτηση που αυτό το κεφάλαιο απάντησε με μία συνάρτηση κόστους — ποιο είναι φθηνότερο; — δεν μπορεί καν να τεθεί μέχρι να ταιριάξουν οι μονάδες, και κανένας calculator στο internet δεν τις κανονικοποιεί.

Είναι επίσης το σημείο όπου το training εμφανίζεται ξανά: ένας image adapter με trigger word, και μια φωνή cloned από sample. Κάτι που εγείρει την ερώτηση με την οποία ανοίγει το επόμενο κεφάλαιο, και δεν είναι ρητορική: αν το fine-tuning ενός language model είναι σχεδόν πάντα λάθος αγορά, γιατί το fine-tuning ενός image model είναι σχεδόν πάντα σωστή;


Κάθε τιμή, threshold και multiplier σε αυτό το κεφάλαιο διαβάστηκε από τη σελίδα του ίδιου του provider στις 7 Σεπτεμβρίου 2026 και παρατίθεται με εκείνη την ημερομηνία, επειδή όλα θα αλλάξουν. Οι μετρημένοι αριθμοί — token counts, chunk sizes, retrieval sizes, training loss, scores, latencies και version-history counts — παράχθηκαν σε ένα μηχάνημα την ίδια ημέρα και είναι αναπαραγώγιμοι από το corpus που περιγράφεται παραπάνω.

Τα τοπικά πειράματα χρησιμοποίησαν Qwen/Qwen2.5-0.5B-Instruct με greedy decoding, άρα αναπαράγονται ακριβώς· ο adapter είναι η κλάση δώδεκα γραμμών που τυπώθηκε παραπάνω, σε rank 8 πάνω στα q_proj και v_proj. Το corpus είναι η tracked Markdown τεκμηρίωση ενός ενεργού software repository, εξαιρώντας δύο append-only logs, και ο ρυθμός αλλαγής του μετρήθηκε από το version history εκείνου του repository.

  1. OpenAI, Supervised fine-tuning, developers.openai.com/api/docs/guides/supervised-fine-tuning, και Model optimization, .../guides/model-optimization, και τα δύο προσπελάστηκαν στις 2026-09-07. Πηγή για: τον πίνακα με το πού είναι καλύτερο το supervised fine-tuning (classification, nuanced translation, παραγωγή περιεχομένου σε συγκεκριμένο format, διόρθωση αποτυχιών instruction-following)· τα τέσσερα δηλωμένα οφέλη, συμπεριλαμβανομένων shorter prompts και lower latency· το ελάχιστο των 10 training examples και τη σύσταση να ξεκινάτε με 50· και το «Only invest in fine-tuning after setting up evals.» 2

  2. Zhou, C. et al. LIMA: Less Is More for Alignment. arXiv:2305.11206 (2023). Η Superficial Alignment Hypothesis — η γνώση έρχεται από το pretraining, το alignment διδάσκει σε ποιο format να μιλά — και ο λόγος που αρκούσαν χίλια επιμελημένα παραδείγματα.

  3. Brown, T. et al. Language Models are Few-Shot Learners. arXiv:2005.14165 (2020). Η πηγή του in-context learning ως ειλικρινούς baseline: η εργασία επιδεικνύεται μέσα στο prompt και κανένα weight δεν ενημερώνεται.

  4. Ovadia, O., Brief, M., Mishaeli, M. and Elisha, O. Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs. arXiv:2312.05934 (2023). Το retrieval κέρδισε το unsupervised fine-tuning για εισαγωγή γνώσης, ακόμη και σε facts που είχαν ήδη φανεί στο pretraining.

  5. Gekhman, Z. et al. Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations? arXiv:2405.05904 (2024). Τα παραδείγματα που εισάγουν νέα γνώση fitted αργά, και το fitting τους αυξάνει το hallucination σε άσχετες ερωτήσεις.

  6. Google, Vertex AI generative AI pricing, cloud.google.com/vertex-ai/generative-ai/pricing, προσπελάστηκε στις 2026-09-07. Κάθε αριθμός στο φύλλο κόστους αυτού του κεφαλαίου: Gemini 3.5 Flash στο global endpoint στα $1.50 ανά εκατομμύριο input tokens, $0.15 cached input και $9.00 text output, με non-global endpoints 10 % υψηλότερα· supervised fine-tuning του ίδιου model στα $0.01 ανά 1,000 training tokens, όπου «training tokens are calculated by the total number of tokens in your training dataset, multiplied by your number of epochs»· explicit context cache storage στα $0.000001 ανά token ανά ώρα· Gemini Embedding input στα $0.00015 ανά 1,000 tokens online· και η σημείωση ότι «for model inference starting from Gemini 3, tuned model endpoint prediction price will be 1.5 times of the base model.» 2 3 4 5

  7. OpenAI, Pricing, developers.openai.com/api/docs/pricing, προσπελάστηκε στις 2026-09-07. Πηγή της wind-down ειδοποίησης που παρατίθεται αυτούσια, και των τρεχουσών text rates που χρησιμοποιήθηκαν για το cross-check: gpt-5.6-terra standard short context στα $2.00 input, $0.20 cached input, $2.50 cache write και $12.00 output ανά εκατομμύριο tokens, με το batch tier στο μισό από το καθένα. Η σελίδα έχει δέκα fine-tuning rows πάνω σε επτά base models, και ακριβώς ένα από αυτά χρεώνεται με χρόνο αντί με tokens: reinforcement fine-tuning του o4-mini-2025-04-16 στα $100.00 ανά training hour. Η ίδια σελίδα σημειώνει 10 % uplift σε data-residency endpoints για models που κυκλοφόρησαν στις ή μετά τις 5 Μαρτίου 2026. 2 3

  8. OpenAI, Deprecations, developers.openai.com/api/docs/deprecations, προσπελάστηκε στις 2026-09-07. Πηγή του self-serve fine-tuning timeline (7 Μαΐου 2026, 2 Ιουλίου 2026, 6 Ιανουαρίου 2027) και του shutdown στις 23 Οκτωβρίου 2026 των ft-gpt-3.5-turbo, ft-gpt-4, ft-gpt-4.1-nano-2025-04-14, ft-babbage-002 και ft-davinci-002, το καθένα καταχωρισμένο με recommended replacement base model.

  9. Anthropic, developer documentation index, platform.claude.com/llms.txt, προσπελάστηκε στις 2026-09-07. 699 καταχωρισμένες σελίδες, καμία για fine-tuning· το platform.claude.com/docs/en/build-with-claude/fine-tuning επιστρέφει 404.

  10. Amazon Web Services, Amazon Bedrock pricing, aws.amazon.com/bedrock/pricing/, προσπελάστηκε στις 2026-09-07. Πηγή των ενοτήτων model-customisation (Amazon Nova, Amazon Titan, Cohere, Meta, Qwen και OpenAI open-weight models — κανένα Claude), της μηνιαίας χρέωσης $1.95 για αποθήκευση κάθε custom model, και του worked example που παρατίθεται: «1 model unit × $21.18 × 24 hours × 31 days = $15,757.92». 2

  11. Together AI, Pricing, together.ai/pricing, προσπελάστηκε στις 2026-09-07. Fine-tuning ανά εκατομμύριο tokens για models έως 16B: $0.48 low-rank και $0.54 full για supervised fine-tuning, $1.20 και $1.35 για direct preference optimisation, με την τιμή να υπολογίζεται ως «training dataset size × number of epochs» συν evaluation tokens και «a minimum charge of $4.00» ανά job. GPU capacity: $3.99 ανά GPU-hour on demand για HGX H100, $1.99 preemptible, $5.99 για H200. 2

Έτοιμοι να αφήσετε τη LIA να επιλέγει;

Δημιουργήστε με κάθε μοντέλο AI σε ένα σημείο — ξεκινήστε δωρεάν σήμερα.