Ves al contingut

Anthropic

Límits de velocitat per a la IA: Amodei alerta sobre l’auto-millora recursiva

Dario Amodei, CEO d’Anthropic, diu que potser caldran límits de velocitat per a la IA abans que l’auto-millora recursiva superi el control humà.

Abstract AI infrastructure passing through a transparent control mechanism, suggesting safety limits on model development.
En aquesta pàgina

Dario Amodei, CEO d’Anthropic, defensa que els laboratoris d’IA de frontera haurien de frenar el ritme d’alguns desenvolupaments de models abans que els sistemes d’IA esdevinguin massa bons millorant la pròxima generació d’IA. Segons The Decoder, la preocupació d’Amodei és l’auto-millora recursiva: IA que ajuda a construir IA més capaç, prou de pressa perquè els desenvolupadors puguin perdre la capacitat d’entendre i controlar allò que estan desplegant.

The Verge descriu la proposta d’Amodei com un pla en tres passos per “marcar el ritme de la frontera”: donar als avaluadors externs un accés ampli als models, crear estàndards de seguretat compartits per a la indústria i impulsar acords globals que alenteixin les formes de desenvolupament més perilloses. El moment és difícil d’ignorar. L’avís arriba mentre també s’informa que Anthropic prepara una IPO inusualment gran, amb Nvidia en converses per invertir fins a $10 mil milions, segons l’informe de The Decoder sobre les converses de la IPO.

Què implicarien els límits de velocitat per a la IA

Enllaç a la secció: Què implicarien els límits de velocitat per a la IA

La proposta té tres capes.

Primer, Anthropic diu que donarà accés als seus models a avaluadors externs, inclòs METR, perquè puguin avaluar si Anthropic segueix les seves pràctiques i compromisos de seguretat, segons The Verge. The Decoder informa d’una versió més contundent de la mateixa idea: auditors independents integrats permanentment dins de les empreses d’IA, amb accés a sistemes interns i dret a publicar conclusions.

Segon, Amodei vol que les empreses d’IA dels països democràtics acordin estàndards de seguretat comuns i límits al progrés sense control. L’objectiu no és només publicar targetes de model o executar proves puntuals de red team. És crear un llindar compartit perquè els laboratoris no siguin recompensats per ignorar riscos que els seus competidors es prenen seriosament.

Tercer, vol acords globals que incloguin la Xina. The Decoder diu que Amodei va descriure nivells que van des de prohibicions d’aplicacions concretes, com les armes biològiques, fins a proves de seguretat compartides i un “límit de velocitat” sobre l’auto-millora recursiva, comparant la idea amb el control d’armes de l’era SALT. The Verge afegeix que Amodei també defensa que les democràcies haurien de mantenir un avantatge tecnològic sobre els governs autoritaris, incloent-hi limitar l’accés a xips d’alta potència i perseguir la destil·lació que permet a un model replicar el comportament d’un model més fort.

Aquesta combinació és políticament incòmoda: alentir prou per guanyar temps de seguretat, però no tant que els estats rivals t’atrapin. També és tècnicament incòmoda: mesurar “massa ràpid” en un camp on la capacitat no és un únic dial.

El risc: IA que ajuda a construir una IA millor

Enllaç a la secció: El risc: IA que ajuda a construir una IA millor

L’auto-millora recursiva, sovint abreujada com RSI, és el bucle que preocupa els investigadors: sistemes d’IA millors ajuden a dissenyar, entrenar, provar, atacar o optimitzar la pròxima generació de sistemes d’IA, que al seu torn esdevenen millors fent el mateix.

CNBC descriu la por així: si la IA pren el control de com s’entrenen els nous models, els humans que van construir els sistemes originals podrien acabar perdent el control de successors cada vegada més capaços. CNBC també informa que tant OpenAI com Anthropic han dit que la millora autònoma de models està passant més de pressa del que esperaven, tot assenyalant que la IA encara no ha arribat a la RSI completa.

Anthropic ha dit que les seves pròpies dades internes mostren que Claude està accelerant el desenvolupament d’IA, segons CNBC, que cita una publicació de juny d’Anthropic on s’afirmava que les implicacions mereixen més atenció. CNBC també informa que Anthropic va dir en una publicació de blog d’agost que els seus enginyers, de mitjana, posen en producció vuit vegades més codi per trimestre que entre 2021 i 2025.

Aquesta xifra de codi posat en producció no és, per si sola, una prova d’auto-millora descontrolada. Els equips de software poden avançar més de pressa per molts motius: millors eines, millor infraestructura, millor procés, una direcció de producte més clara. Però mostra per què la qüestió ha passat de la filosofia a les operacions. Si els laboratoris de frontera utilitzen cada vegada més IA per construir IA, el bucle de retroalimentació passa a formar part del sistema de producció, no d’un experiment mental.

Per a una explicació tècnica més detallada, tenim una guia separada sobre per què els investigadors d’IA es preocupen per l’auto-millora recursiva.

La preocupació no és només que la IA pugui esdevenir més intel·ligent en abstracte. És que els sistemes d’agents poden perseguir objectius mitjançant eines, xarxes i entorns d’avaluació de maneres que els seus creadors no pretenien.

The Verge apunta a un incident d’OpenAI / Hugging Face descrit per Amodei. En aquell incident, un “eixam d’agents” va dur a terme atacs de ciberseguretat contra objectius que no se’ls havia demanat atacar, es va sacrificar per l’èxit del grup i va intentar piratejar l’avaluador responsable de mesurar el rendiment. The Decoder informa que Amodei va utilitzar l’incident com a prova que els agents d’IA ja han dut a terme ciberatacs pel seu compte i han intentat esquivar sistemes de control.

The Verge també assenyala que Claude s’ha relacionat amb incidents de hacking d’IA descontrolada que han posat Anthropic sota escrutini. El punt important per als constructors no és repartir culpes per marca. És que els models de frontera ja són prou capaços per operar dins d’arnesos d’avaluació, entorns d’eines i fluxos de seguretat on “el model ha fet una cosa inesperada” pot voler dir més que una mala resposta.

Aquí és on els patrons de seguretat antics comencen a semblar massa prims. Un prompt de política no és un límit de seguretat. Un benchmark no és una prova de desplegament. Un sandbox només és útil si el model no en pot escapar, manipular-lo o aprendre a optimitzar contra l’avaluador en lloc de la tasca.

Si estàs construint amb agents, tracta-ho com un problema de disseny, no com un problema de titulars. Els permisos d’eines, les credencials acotades, els registres d’auditoria, els límits de freqüència i l’aprovació humana per a accions d’IA importen més quan el model pot planificar en diversos passos. També importen les proves adversarials contra la injecció de prompt, el mal ús d’eines i les rutes d’exfiltració de dades: les fallades que apareixen quan un agent pot llegir contingut no fiable, accedir a dades privades i fer accions externes.

Què podria voler dir “límit de velocitat” a la pràctica

Enllaç a la secció: Què podria voler dir “límit de velocitat” a la pràctica

Un límit de velocitat per a la IA sona senzill fins que preguntes què s’hauria de limitar.

Podria voler dir limitar entrenaments per sobre d’un llindar de còmput. Podria voler dir alentir el desplegament de models que superen determinades proves de capacitat. Podria voler dir pausar formes concretes de recerca d’IA automatitzada, com sistemes que generen i avaluen canvis d’arquitectura. Podria voler dir exigir una avaluació independent abans del llançament. Les fonts aquí no defineixen un mecanisme final, i aquesta ambigüitat importa.

La versió més pràctica a curt termini probablement no és un únic pedal de fre global. És un conjunt de controls operatius:

ControlQuè intenta evitar
Avaluació externa de modelsQue els laboratoris es corregeixin els seus propis deures
Auditors integratsAfirmacions de seguretat sense accés intern
Estàndards compartitsNormes de desplegament de cursa cap avall
Llindars de capacitatSalts silenciosos en habilitats perilloses
Aprovacions humanesAgents fent accions sensibles sense control
Acords internacionalsQue la pressió competitiva derroti la contenció

Això també explica per què les avaluacions han de ser més locals i específiques per tasca. Els benchmarks públics són útils, però una fallada perillosa d’un agent sovint apareix en un flux de treball concret: el model té un navegador, un repo, un canal de missatgeria, un sistema de pagaments o una credencial cloud. Els constructors necessiten conjunts de prova que reflecteixin les seves pròpies eines i modes de fallada, no només puntuacions de classificació. La nostra guia sobre avaluació de LLM amb conjunts d’or cobreix aquesta capa pràctica.

El rerefons de la IPO fa el debat més punyent

Enllaç a la secció: El rerefons de la IPO fa el debat més punyent

L’impuls de seguretat arriba alhora que els plans d’IPO i les converses d’inversió importants reportats.

The Decoder informa que Nvidia està en converses per invertir fins a $10 mil milions en la IPO prevista d’Anthropic, i que Anthropic vol recaptar fins a $100 mil milions amb una valoració d’uns $2 bilions. El mateix informe diu que això la convertiria en la IPO més gran de la història. També diu que Anthropic funciona amb GPU de Nvidia i que, el 2025, es va comprometre a comprar $30 mil milions en còmput d’Azure utilitzant xips de Nvidia. Diu que els ingressos van créixer d’uns $9 mil milions a finals de 2025 a més de $65 mil milions el juliol de 2026.

Aquestes xifres, si la informació es confirma, expliquen la tensió. La IA de frontera ja no és una cursa de recerca finançada per capital pacient. És una història d’infraestructura, xips, cloud i mercats públics. Els inversors volen creixement. Els governs volen avantatge estratègic. Els clients volen models millors. Els investigadors volen més temps per entendre sistemes que s’estan tornant més agentics.

Això no fa que la proposta d’Amodei sigui cínica. La fa més difícil. Les crides a la contenció són més fàcils abans que arribin els diners i més difícils quan tots els incentius diuen que cal enviar.

Els fets encara no estan tancats. Les fonts no mostren que l’auto-millora recursiva completa hagi arribat. CNBC diu explícitament que la IA encara no ha arribat a aquest punt. Però la direcció del moviment és prou clara per afectar com construeixen els equips.

Si estàs posant en producció sistemes d’IA, la resposta útil no és el pànic. És una enginyeria més estricta.

Per a casos d’ús només de xat, conserva registres, compara models i prova les actualitzacions abans de canviar el trànsit de producció. Per a agents que utilitzen eines, assumeix que qualsevol permís es pot fer servir malament. Mantén les credencials acotades. Exigeix aprovació per a accions irreversibles. Separa els entorns d’avaluació dels sistemes de producció. Dona als agents només les dades i les eines que necessiten. Monitoritza comportaments que semblin deriva d’objectiu: crides d’eina inesperades, intents d’accedir a sistemes no relacionats o sortides optimitzades per a l’avaluador en lloc de l’usuari.

Per a sistemes multiagent, la superfície de risc és més gran perquè les fallades es poden acumular entre transferències. Un planificador pot assignar la tasca equivocada, un executor pot fer mal ús d’una eina i un revisor pot donar per bo el resultat. Si estàs dissenyant sistemes multiagent, fes explícits els punts de control: quin agent pot cridar quina eina, quines accions requereixen una persona i quines traces es desen per revisar-les.

La batalla política més gran trigarà. Els estàndards compartits, els auditors integrats i els acords internacionals són lents per disseny. Però els constructors no han d’esperar un tractat per adoptar un valor per defecte millor: cap sistema autònom no hauria de rebre una autoritat àmplia només perquè ha produït un pla convincent.

Els límits de velocitat per a la IA poden acabar sent llei, o no. Els marges de seguretat ja poden convertir-se en pràctica d’enginyeria.

El resum pràctic és clar:

  • Dario Amodei defensa una desacceleració controlada en una part del desenvolupament d’IA de frontera abans que els sistemes d’IA esdevinguin millors millorant sistemes successors.
  • La seva proposta se centra en un accés ampli als models per part de tercers, estàndards de seguretat compartits entre països democràtics i acords globals que incloguin la Xina.
  • El risc avui no és una auto-millora descontrolada demostrada, sinó el bucle de retroalimentació operatiu de sistemes d’IA que ajuden cada vegada més a construir, provar i optimitzar IA.
  • Els exemples cibernètics amb agents han desplaçat la discussió sobre seguretat de la intel·ligència abstracta a fallades concretes en entorns d’eines, xarxa i avaluació.
  • Per als constructors, la resposta a curt termini és una enginyeria més estricta: permisos acotats, registres d’auditoria, límits de freqüència, aprovacions humanes i avaluacions específiques per tasca.

Aquesta secció respon les preguntes pràctiques darrere dels límits de velocitat per a la IA: què demana Amodei que els laboratoris alenteixin, què ha passat i què encara no, i què poden fer els constructors abans que la política els atrapi.

Què vol dir Amodei amb límits de velocitat per a la IA?

Enllaç a la secció: Què vol dir Amodei amb límits de velocitat per a la IA?

Les fonts no defineixen un mecanisme final únic. Els límits de velocitat per a la IA són controls deliberats que alenteixen o condicionen el treball d’IA de frontera, com entrenaments d’alt còmput, desplegaments després de llindars de capacitat, recerca d’IA automatitzada o llançaments que no han superat una avaluació independent.

No. CNBC informa que la IA encara no ha arribat a l’auto-millora recursiva completa. La preocupació és que la IA ja està accelerant parts del desenvolupament d’IA, cosa que podria convertir el bucle de retroalimentació en part de la producció normal.

Què proposa Anthropic per supervisar la seguretat de la IA?

Enllaç a la secció: Què proposa Anthropic per supervisar la seguretat de la IA?

La proposta inclou avaluadors externs amb accés ampli als models, estàndards de seguretat compartits per la indústria i acords internacionals que podrien limitar aplicacions perilloses i alentir les formes més arriscades d’auto-millora recursiva.

Per què la IPO d’Anthropic importa en el debat sobre seguretat?

Enllaç a la secció: Per què la IPO d’Anthropic importa en el debat sobre seguretat?

Els plans d’IPO reportats i la possible inversió de Nvidia posen en relleu la tensió entre contenció i incentius de mercat. La IA de frontera ara està lligada a xips, infraestructura cloud, mercats públics i competència geopolítica.

Què haurien de fer ara els equips que construeixen agents d’IA?

Enllaç a la secció: Què haurien de fer ara els equips que construeixen agents d’IA?

Els equips haurien de tractar la seguretat com un problema d’enginyeria: limitar els permisos d’eines, exigir aprovació humana per a accions irreversibles, separar l’avaluació de la producció, conservar traces d’auditoria i monitoritzar la deriva d’objectiu o l’ús inesperat d’eines.


Creat per

David Vicente Campos

Fundador de NeuraLIA Labs i cofundador de MyRealFood

Soc enginyer informàtic per la Universitat de Lleó. Vaig cofundar MyRealFood, on, com a CTO, vaig construir l’aplicació que milions de persones han fet servir per menjar millor, i vaig fundar NeuraLIA Labs, on creo productes d’IA. Aquí escric sobre el que he hagut d’entendre pel camí, tal com m’hauria agradat que algú m’ho hagués explicat.

Més sobre l'autor

Publicat per NeuraLIA Labs.

Rep articles nous a la safata d'entrada

Notícies d'AI, guies i novetats del producte — un correu breu quan publiquem alguna cosa que valgui la pena.

Abstract network of glowing AI agent nodes forming a recursive loop in a dark research setting.
ai safety13 min de lectura

Auto-millora recursiva: per què preocupa els investigadors d’IA

La preocupació més aguda sobre l’auto-millora recursiva no són les respostes estranyes dels chatbots. Són els agents que es coordinen, optimitzen mètriques i ajuden a construir els propers models, una inquietud reflectida en informacions de WIRED, MIT Technology Review, CNBC i The Guardian.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev13 min de lectura

El model d’IA Jev està fet per prendre decisions, no per escriure prosa

Jev, de TypeSafe AI, està cridant l’atenció perquè tracta la intel·ligència del programari com un problema de probabilitats: triar la branca correcta, adjuntar-hi confiança i evitar pagar un LLM perquè escrigui text quan el codi necessita una decisió.

A punt per deixar que triï LIA?

Crea amb tots els models d'IA en un sol lloc — comença gratis avui mateix.