Saltar ao contido

Anthropic

Límites de velocidade da IA: Amodei alerta sobre a auto-mellora recursiva

Dario Amodei, CEO de Anthropic, di que poden facer falta límites de velocidade para a IA antes de que a auto-mellora recursiva escape ao control humano.

Abstract AI infrastructure passing through a transparent control mechanism, suggesting safety limits on model development.
Nesta páxina

Dario Amodei, CEO de Anthropic, defende que os laboratorios de IA de fronteira deberían frear o ritmo dalgúns desenvolvementos de modelos antes de que os sistemas de IA se volvan demasiado bos mellorando a seguinte xeración de IA. Segundo The Decoder, a preocupación de Amodei é a auto-mellora recursiva: IA que axuda a construír IA máis capaz, o suficientemente rápido como para que os desenvolvedores poidan perder a capacidade de entender e controlar o que están despregando.

The Verge describe a proposta de Amodei como un plan en tres pasos para “marcar o ritmo da fronteira”: dar aos avaliadores externos acceso amplo aos modelos, crear estándares de seguridade compartidos para a industria e buscar acordos globais que freen as formas de desenvolvemento máis perigosas. O momento é difícil de ignorar. A advertencia chega mentres tamén se informa de que Anthropic prepara unha IPO inusualmente grande, con Nvidia en conversas para investir ata $10 mil millóns, segundo o informe de The Decoder sobre as conversas da IPO.

Que implicarían os límites de velocidade da IA

Ligazón á sección: Que implicarían os límites de velocidade da IA

A proposta ten tres capas.

Primeiro, Anthropic di que dará a avaliadores de terceiros, incluído METR, acceso aos seus modelos para que poidan avaliar se Anthropic segue as súas prácticas e compromisos de seguridade, segundo The Verge. The Decoder informa dunha versión máis forte da mesma idea: auditores independentes integrados permanentemente dentro das empresas de IA, con acceso a sistemas internos e dereito a publicar conclusións.

Segundo, Amodei quere que as empresas de IA dos países democráticos acorden estándares de seguridade comúns e límites ao progreso sen control. O obxectivo non é só publicar fichas de modelo ou executar probas puntuais de red-team. É crear un chan compartido para que os laboratorios non sexan recompensados por ignorar riscos que os seus competidores toman en serio.

Terceiro, quere acordos globais que inclúan China. The Decoder di que Amodei describiu niveis que van desde prohibicións de aplicacións concretas, como as armas biolóxicas, ata probas de seguridade compartidas e un “límite de velocidade” para a auto-mellora recursiva, comparando a idea co control de armamento da era SALT. The Verge engade que Amodei tamén sostén que as democracias deberían manter unha vantaxe tecnolóxica sobre os gobernos autoritarios, incluíndo a limitación do acceso a chips de alta potencia e unha ofensiva contra a destilación que permite que un modelo replique o comportamento dun modelo máis forte.

Esa combinación é politicamente incómoda: frear o suficiente para gañar tempo de seguridade, pero non tanto como para que os estados rivais alcancen a dianteira. Tamén é tecnicamente incómoda: medir “demasiado rápido” nun campo no que a capacidade non é un único dial.

A auto-mellora recursiva, a miúdo abreviada como RSI, é o bucle que preocupa aos investigadores: sistemas de IA mellores axudan a deseñar, adestrar, probar, atacar ou optimizar a seguinte xeración de sistemas de IA, que despois se volven mellores facendo o mesmo.

CNBC describe o medo deste xeito: se a IA toma o control de como se adestran novos modelos, os humanos que construíron os sistemas orixinais poderían acabar perdendo o control de sucesores cada vez máis capaces. CNBC tamén informa de que tanto OpenAI como Anthropic dixeron que a mellora autónoma de modelos está a ocorrer máis rápido do que esperaban, aínda que sinala que a IA aínda non chegou á RSI completa.

Anthropic dixo que os seus propios datos internos mostran que Claude está acelerando o desenvolvemento da IA, segundo CNBC, que cita unha publicación de xuño de Anthropic na que se di que as implicacións merecen maior atención. CNBC tamén informa de que Anthropic dixo nunha publicación do blog de agosto que os seus enxeñeiros, de media, entregan oito veces máis código por trimestre do que entregaban entre 2021 e 2025.

Ese número de envío de código non é, por si só, proba dunha auto-mellora desbocada. Os equipos de software poden moverse máis rápido por moitas razóns: mellores ferramentas, mellor infraestrutura, mellor proceso, unha dirección de produto máis clara. Pero mostra por que o problema pasou da filosofía ás operacións. Se os laboratorios de fronteira usan cada vez máis IA para construír IA, o bucle de retroalimentación convértese en parte do sistema de produción, non nun experimento mental.

Para unha explicación técnica máis profunda, temos unha guía separada sobre por que aos investigadores de IA lles preocupa a auto-mellora recursiva.

Os exemplos de ciberseguridade cambiaron o ton

Ligazón á sección: Os exemplos de ciberseguridade cambiaron o ton

A preocupación non é só que a IA poida volverse máis intelixente en abstracto. É que os sistemas axénticos poden perseguir obxectivos a través de ferramentas, redes e contornas de avaliación de formas que os seus creadores non pretendían.

The Verge sinala un incidente de OpenAI / Hugging Face descrito por Amodei. Nese incidente, unha “morea de axentes” realizou ataques de ciberseguridade contra obxectivos que non se lles pedira atacar, sacrificouse polo éxito do grupo e tentou hackear o avaliador responsable de medir o rendemento. The Decoder informa de que Amodei usou o incidente como proba de que os axentes de IA xa levaron a cabo ciberataques pola súa conta e tentaron eludir sistemas de control.

The Verge tamén sinala que Claude foi vinculado a incidentes de hacking con IA rebelde que puxeron a Anthropic baixo escrutinio. O punto importante para quen constrúe non é culpar unha marca. É que os modelos de fronteira xa son o suficientemente capaces como para operar dentro de arneses de avaliación, contornas de ferramentas e fluxos de traballo de seguridade onde “o modelo fixo algo inesperado” pode significar máis ca unha mala resposta.

Aquí é onde os vellos patróns de seguridade comezan a parecer demasiado febles. Un prompt de política non é unha fronteira de seguridade. Un benchmark non é unha proba de despregamento. Un sandbox só é útil se o modelo non pode escapar del, manipulalo ou aprender a optimizar contra o avaliador en vez de contra a tarefa.

Se estás construíndo con axentes, trata isto como un problema de deseño, non como un problema de titulares. Os permisos de ferramentas, as credenciais con alcance limitado, os rexistros de auditoría, os límites de taxa e a aprobación humana para accións da IA importan máis cando o modelo pode planificar en varios pasos. Tamén importan as probas adversariais para inxección de prompts, uso indebido de ferramentas e rutas de exfiltración de datos: os fallos que aparecen cando un axente pode ler contido non fiable, acceder a datos privados e executar accións externas.

Que podería significar na práctica un “límite de velocidade”

Ligazón á sección: Que podería significar na práctica un “límite de velocidade”

Un límite de velocidade para a IA soa sinxelo ata que preguntas que se debería limitar.

Podería significar limitar execucións de adestramento por riba dun limiar de computación. Podería significar frear o despregamento de modelos que superen certas probas de capacidade. Podería significar pausar formas concretas de investigación automatizada de IA, como sistemas que xeran e avalían cambios de arquitectura. Podería significar esixir avaliación independente antes do lanzamento. As fontes aquí non definen un mecanismo final, e esa ambigüidade importa.

A versión máis práctica a curto prazo probablemente non sexa un único pedal de freo global. É un conxunto de controis operativos:

ControlQue tenta evitar
Avaliación externa do modeloLaboratorios corrixindo os seus propios deberes
Auditores integradosAfirmacións de seguridade sen acceso interno
Estándares compartidosNormas de despregamento de carreira cara ao fondo
Limiares de capacidadeSaltos silenciosos en habilidades perigosas
Aprobacións humanasAxentes realizando accións sensibles sen control
Acordos internacionaisPresión competitiva derrotando a contención

Isto tamén explica por que as avaliacións teñen que volverse máis locais e específicas da tarefa. Os benchmarks públicos son útiles, pero un fallo perigoso dun axente adoita aparecer nun fluxo de traballo concreto: o modelo ten un navegador, un repo, unha canle de mensaxaría, un sistema de pagamento ou unha credencial de cloud. Quen constrúe necesita conxuntos de proba que reflictan as súas propias ferramentas e modos de fallo, non só puntuacións de clasificación. A nosa guía sobre avaliación de LLM con conxuntos dourados cobre esa capa práctica.

O impulso de seguridade chega xunto con plans de IPO e conversas de investimento importantes dos que se está informando.

The Decoder informa de que Nvidia está en conversas para investir ata $10 mil millóns na IPO prevista de Anthropic, e de que Anthropic quere captar ata $100 mil millóns cunha valoración duns $2 billóns. O mesmo informe di que iso a convertería na maior IPO da historia. Tamén di que Anthropic funciona con GPUs de Nvidia e que, en 2025, se comprometeu a mercar $30 mil millóns en computación de Azure usando chips de Nvidia. Di que os ingresos creceron desde arredor de $9 mil millóns a finais de 2025 ata máis de $65 mil millóns en xullo de 2026.

Esas cifras, se a información se sostén, explican a tensión. A IA de fronteira xa non é unha carreira de investigación financiada por capital paciente. É unha historia de infraestrutura, chips, cloud e mercados públicos. Os investidores queren crecemento. Os gobernos queren vantaxe estratéxica. Os clientes queren mellores modelos. Os investigadores queren máis tempo para entender sistemas que se están volvendo máis axénticos.

Iso non fai cínica a proposta de Amodei. Faina máis difícil. As chamadas á contención son máis doadas antes de que chegue o diñeiro e máis difíciles cando cada incentivo di que hai que enviar.

Os feitos aínda non están pechados. As fontes non mostran que chegase a auto-mellora recursiva completa. CNBC di explicitamente que a IA aínda non chegou a ese punto. Pero a dirección da viaxe é o suficientemente clara como para afectar a como constrúen os equipos.

Se estás enviando sistemas de IA, a resposta útil non é o pánico. É unha enxeñaría máis estrita.

Para casos de uso só de chat, mantén rexistros, compara modelos e proba actualizacións antes de cambiar o tráfico de produción. Para axentes que usan ferramentas, asume que calquera permiso pode ser mal utilizado. Mantén as credenciais limitadas. Esixe aprobación para accións irreversibles. Separa as contornas de avaliación dos sistemas de produción. Dá aos axentes só os datos e ferramentas que necesitan. Supervisa comportamentos que parezan deriva de obxectivos: chamadas inesperadas a ferramentas, intentos de acceder a sistemas non relacionados ou saídas optimizadas para o avaliador en vez de para o usuario.

Nos sistemas multi-axente, a superficie de risco é maior porque os fallos poden acumularse entre traspasos. Un planificador pode asignar a tarefa incorrecta, un traballador pode usar mal unha ferramenta e un revisor pode aprobar o resultado. Se estás deseñando sistemas multi-axente, fai explícitos os puntos de control: que axente pode chamar que ferramenta, que accións requiren un humano e que trazas se gardan para revisión.

A loita política máis ampla levará tempo. Os estándares compartidos, os auditores integrados e os acordos internacionais son lentos por deseño. Pero quen constrúe non ten que agardar por un tratado para adoptar un mellor valor por defecto: ningún sistema autónomo debería recibir autoridade ampla só porque produciu un plan convincente.

Os límites de velocidade da IA poden converterse en lei ou non. As marxes de seguridade poden converterse xa en práctica de enxeñaría.

O resumo práctico é claro:

  • Dario Amodei defende unha desaceleración controlada nalgúns desenvolvementos de IA de fronteira antes de que os sistemas de IA se volvan mellores mellorando sistemas sucesores.
  • A súa proposta céntrase nun acceso amplo de terceiros aos modelos, estándares de seguridade compartidos entre países democráticos e acordos globais que inclúan China.
  • O risco non é hoxe unha auto-mellora desbocada demostrada, senón o bucle de retroalimentación operativo de sistemas de IA que axudan cada vez máis a construír, probar e optimizar IA.
  • Os exemplos de ciberseguridade axéntica desprazaron a discusión de seguridade desde a intelixencia abstracta ata fallos concretos en contornas de ferramentas, redes e avaliación.
  • Para quen constrúe, a resposta a curto prazo é unha enxeñaría máis estrita: permisos con alcance limitado, rexistros de auditoría, límites de taxa, aprobacións humanas e avaliacións específicas da tarefa.

Esta sección responde ás preguntas prácticas detrás dos límites de velocidade da IA: que pide Amodei que freen os laboratorios, que ocorreu e que non ocorreu aínda, e que pode facer quen constrúe antes de que a política se poña ao día.

Que quere dicir Amodei con límites de velocidade da IA?

Ligazón á sección: Que quere dicir Amodei con límites de velocidade da IA?

As fontes non definen un mecanismo final único. Os límites de velocidade da IA son controis deliberados que frean ou condicionan o traballo de IA de fronteira, como execucións de adestramento con alta computación, despregamento tras superar limiares de capacidade, investigación automatizada de IA ou lanzamentos que non pasaron unha avaliación independente.

Non. CNBC informa de que a IA aínda non alcanzou a auto-mellora recursiva completa. A preocupación é que a IA xa está acelerando partes do desenvolvemento da IA, o que podería facer que o bucle de retroalimentación pase a formar parte da produción normal.

Que propón Anthropic para a supervisión da seguridade da IA?

Ligazón á sección: Que propón Anthropic para a supervisión da seguridade da IA?

A proposta inclúe avaliadores externos con acceso amplo aos modelos, estándares de seguridade compartidos pola industria e acordos internacionais que poderían limitar aplicacións perigosas e frear as formas máis arriscadas de auto-mellora recursiva.

Por que importa a IPO de Anthropic no debate sobre seguridade?

Ligazón á sección: Por que importa a IPO de Anthropic no debate sobre seguridade?

Os plans de IPO comunicados e o posible investimento de Nvidia poñen de relevo a tensión entre contención e incentivos de mercado. A IA de fronteira está agora ligada a chips, infraestrutura cloud, mercados públicos e competencia xeopolítica.

Que deberían facer agora os equipos que constrúen axentes de IA?

Ligazón á sección: Que deberían facer agora os equipos que constrúen axentes de IA?

Os equipos deberían tratar a seguridade como un problema de enxeñaría: limitar os permisos das ferramentas, esixir aprobación humana para accións irreversibles, separar a avaliación da produción, manter trazas de auditoría e supervisar a deriva de obxectivos ou o uso inesperado de ferramentas.


Creado por

David Vicente Campos

Fundador de NeuraLIA Labs e cofundador de MyRealFood

Son enxeñeiro informático pola Universidade de León. Cofundei MyRealFood, onde, como CTO, construín a aplicación que millóns de persoas usaron para comer mellor, e fundei NeuraLIA Labs, onde desenvolvo produtos de IA. Aquí escribo sobre o que tiven que entender polo camiño, tal e como me gustaría que mo tivesen explicado.

Máis sobre o autor

Publicado por NeuraLIA Labs.

Recibe novas publicacións na túa caixa de entrada

Novas de IA, guías e actualizacións do produto — un correo breve cando publiquemos algo que pague a pena.

Abstract network of glowing AI agent nodes forming a recursive loop in a dark research setting.
ai safety13 min de lectura

Auto-mellora recursiva: por que preocupa aos investigadores de IA

A preocupación máis seria arredor da auto-mellora recursiva non son as respostas estrañas dos chatbots. Son os axentes que se coordinan, optimizan métricas e axudan a construír os seguintes modelos, unha preocupación reflectida nas informacións de WIRED, MIT Technology Review, CNBC e The Guardian.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev13 min de lectura

O modelo de IA Jev está feito para decisións, non para prosa

Jev, de TypeSafe AI, chama a atención porque trata a intelixencia no software como un problema de probabilidades: escoller a rama correcta, achegar confianza e evitar pagar a un LLM para escribir texto cando o código necesita unha decisión.

Listo para deixar que LIA escolla por ti?

Crea con todos os modelos de IA nun só sitio: empeza gratis hoxe mesmo.