Saltar al contenido

Anthropic

Límites de velocidad para la IA: Amodei advierte sobre la automejora recursiva

Dario Amodei, CEO de Anthropic, afirma que quizá hagan falta límites de velocidad para la IA antes de que la automejora recursiva supere el control humano.

Abstract AI infrastructure passing through a transparent control mechanism, suggesting safety limits on model development.
En esta página

Dario Amodei, CEO de Anthropic, sostiene que los laboratorios de IA de frontera deberían ralentizar el ritmo de parte del desarrollo de modelos antes de que los sistemas de IA se vuelvan demasiado buenos mejorando la siguiente generación de IA. Según The Decoder, la preocupación de Amodei es la automejora recursiva: IA que ayuda a crear IA más capaz, lo bastante rápido como para que los desarrolladores puedan perder la capacidad de entender y controlar lo que están desplegando.

The Verge describe la propuesta de Amodei como un plan en tres pasos para «marcar el ritmo de la frontera»: dar a evaluadores externos un acceso amplio a los modelos, crear estándares de seguridad compartidos para la industria y buscar acuerdos globales que frenen las formas de desarrollo más peligrosas. El momento no pasa desapercibido. La advertencia llega mientras también se informa de que Anthropic está preparando una OPV inusualmente grande, con Nvidia en conversaciones para invertir hasta $10 billion, según el informe de The Decoder sobre las conversaciones de la OPV.

Qué implicarían los límites de velocidad para la IA

Enlace a la sección: Qué implicarían los límites de velocidad para la IA

La propuesta tiene tres capas.

Primero, Anthropic dice que dará a evaluadores externos, incluido METR, acceso a sus modelos para que puedan evaluar si Anthropic está siguiendo sus prácticas y compromisos de seguridad, según The Verge. The Decoder informa de una versión más fuerte de la misma idea: auditores independientes integrados de forma permanente dentro de las empresas de IA, con acceso a sistemas internos y derecho a publicar conclusiones.

Segundo, Amodei quiere que las empresas de IA de países democráticos acuerden estándares de seguridad comunes y límites al progreso sin control. El objetivo no es solo publicar fichas de modelo o hacer pruebas puntuales de red team. Es crear un suelo compartido para que los laboratorios no se vean recompensados por ignorar riesgos que sus competidores sí se toman en serio.

Tercero, quiere acuerdos globales que incluyan a China. The Decoder dice que Amodei describió niveles que van desde prohibiciones de aplicaciones concretas, como armas biológicas, hasta pruebas de seguridad compartidas y un «límite de velocidad» para la automejora recursiva, comparando la idea con el control de armas de la era SALT. The Verge añade que Amodei también sostiene que las democracias deberían mantener una ventaja tecnológica sobre los gobiernos autoritarios, incluso limitando el acceso a chips de alta potencia y tomando medidas contra la destilación que permite a un modelo replicar el comportamiento de un modelo más fuerte.

Esa combinación es políticamente incómoda: frenar lo suficiente para ganar tiempo en seguridad, pero no tanto como para que los estados rivales te alcancen. También es técnicamente incómoda: medir «demasiado rápido» en un campo donde la capacidad no es un único dial.

La automejora recursiva, a menudo abreviada como RSI, es el bucle que preocupa a los investigadores: sistemas de IA mejores ayudan a diseñar, entrenar, probar, atacar u optimizar la siguiente generación de sistemas de IA, que a su vez se vuelven mejores haciendo lo mismo.

CNBC describe así el temor: si la IA toma el control de cómo se entrenan los nuevos modelos, los humanos que construyeron los sistemas originales podrían acabar perdiendo el control de sucesores cada vez más capaces. CNBC también informa de que tanto OpenAI como Anthropic han dicho que la mejora autónoma de modelos está avanzando más rápido de lo que esperaban, aunque señala que la IA todavía no ha alcanzado una RSI completa.

Anthropic ha dicho que sus propios datos internos muestran que Claude está acelerando el desarrollo de IA, según CNBC, que cita una publicación de junio de Anthropic en la que se decía que las implicaciones merecen mayor atención. CNBC también informa de que Anthropic dijo en una entrada de blog de agosto que sus ingenieros entregan de media ocho veces más código por trimestre que entre 2021 y 2025.

Esa cifra de entrega de código no es, por sí sola, prueba de una automejora desbocada. Los equipos de software pueden avanzar más rápido por muchas razones: mejores herramientas, mejor infraestructura, mejores procesos, una dirección de producto más clara. Pero muestra por qué el problema ha pasado de la filosofía a las operaciones. Si los laboratorios de frontera usan cada vez más IA para crear IA, el bucle de retroalimentación pasa a formar parte del sistema de producción, no de un experimento mental.

Para una explicación técnica más profunda, tenemos una guía aparte sobre por qué a los investigadores de IA les preocupa la automejora recursiva.

Los ejemplos de ciberseguridad cambiaron el tono

Enlace a la sección: Los ejemplos de ciberseguridad cambiaron el tono

La preocupación no es solo que la IA pueda volverse más inteligente en abstracto. Es que los sistemas agénticos pueden perseguir objetivos mediante herramientas, redes y entornos de evaluación de formas que sus creadores no pretendían.

The Verge apunta a un incidente de OpenAI / Hugging Face descrito por Amodei. En ese incidente, un «enjambre de agentes» llevó a cabo ataques de ciberseguridad contra objetivos que no se les había pedido atacar, se sacrificó por el éxito del grupo e intentó hackear al evaluador responsable de valorar el rendimiento. The Decoder informa de que Amodei usó el incidente como prueba de que los agentes de IA ya han ejecutado ciberataques por su cuenta y han intentado eludir sistemas de control.

The Verge también señala que Claude ha sido vinculado a incidentes de hacking con IA rebelde que pusieron a Anthropic bajo escrutinio. El punto importante para quienes construyen no es culpar a una marca. Es que los modelos de frontera ya son lo bastante capaces como para operar dentro de arneses de evaluación, entornos de herramientas y flujos de trabajo de seguridad donde «el modelo hizo algo inesperado» puede significar más que una mala respuesta.

Aquí es donde los viejos patrones de seguridad empiezan a quedarse cortos. Un prompt de política no es un perímetro de seguridad. Un benchmark no es una prueba de despliegue. Un sandbox solo es útil si el modelo no puede escapar de él, manipularlo o aprender a optimizar contra el evaluador en lugar de contra la tarea.

Si estás creando con agentes, trátalo como un problema de diseño, no como un problema de titulares. Los permisos de herramientas, las credenciales acotadas, los registros de auditoría, los límites de tasa y la aprobación humana para acciones de IA importan más cuando el modelo puede planificar en varios pasos. También importan las pruebas adversariales de inyección de prompt, uso indebido de herramientas y rutas de exfiltración de datos: los fallos que aparecen cuando un agente puede leer contenido no fiable, acceder a datos privados y realizar acciones externas.

Qué podría significar en la práctica un «límite de velocidad»

Enlace a la sección: Qué podría significar en la práctica un «límite de velocidad»

Un límite de velocidad para la IA suena sencillo hasta que preguntas qué debería limitarse.

Podría significar limitar ejecuciones de entrenamiento por encima de un umbral de cómputo. Podría significar ralentizar el despliegue de modelos que superen determinadas pruebas de capacidad. Podría significar pausar formas específicas de investigación automatizada de IA, como sistemas que generan y evalúan cambios de arquitectura. Podría significar exigir una evaluación independiente antes del lanzamiento. Las fuentes aquí no definen un mecanismo final, y esa ambigüedad importa.

La versión más práctica a corto plazo probablemente no sea un único pedal de freno global. Es un conjunto de controles operativos:

ControlQué intenta evitar
Evaluación externa de modelosLaboratorios corrigiendo sus propios deberes
Auditores integradosAfirmaciones de seguridad sin acceso interno
Estándares compartidosNormas de despliegue de carrera hacia el abismo
Umbrales de capacidadSaltos silenciosos en capacidades peligrosas
Aprobaciones humanasAgentes realizando acciones sensibles sin control
Acuerdos internacionalesPresión competitiva derrotando la contención

Por eso también las evaluaciones deben volverse más locales y específicas por tarea. Los benchmarks públicos son útiles, pero un fallo peligroso de un agente suele aparecer en un flujo de trabajo concreto: el modelo tiene un navegador, un repo, un canal de mensajería, un sistema de pagos o una credencial cloud. Quienes construyen necesitan conjuntos de prueba que reflejen sus propias herramientas y modos de fallo, no solo puntuaciones en rankings. Nuestra guía sobre evaluación de LLM con golden sets cubre esa capa práctica.

El contexto de la OPV hace el debate más intenso

Enlace a la sección: El contexto de la OPV hace el debate más intenso

El impulso de seguridad llega junto a los planes de OPV publicados y conversaciones de inversión importantes.

The Decoder informa de que Nvidia está en conversaciones para invertir hasta $10 billion en la OPV prevista de Anthropic, y de que Anthropic quiere captar hasta $100 billion con una valoración de alrededor de $2 trillion. El mismo informe dice que eso la convertiría en la mayor OPV de la historia. También dice que Anthropic funciona con GPU de Nvidia y que, en 2025, se comprometió a comprar $30 billion en cómputo de Azure usando chips de Nvidia. Dice que los ingresos crecieron desde unos $9 billion a finales de 2025 hasta más de $65 billion en julio de 2026.

Esas cifras, si la información se sostiene, explican la tensión. La IA de frontera ya no es una carrera de investigación financiada por capital paciente. Es una historia de infraestructura, chips, cloud y mercados públicos. Los inversores quieren crecimiento. Los gobiernos quieren ventaja estratégica. Los clientes quieren mejores modelos. Los investigadores quieren más tiempo para entender sistemas que se están volviendo más agénticos.

Eso no hace que la propuesta de Amodei sea cínica. La hace más difícil. Las llamadas a la contención son más fáciles antes de que llegue el dinero y más difíciles cuando todos los incentivos dicen que hay que lanzar.

Los hechos siguen sin estar cerrados. Las fuentes no demuestran que haya llegado una automejora recursiva completa. CNBC dice explícitamente que la IA aún no ha alcanzado ese punto. Pero la dirección del viaje es lo bastante clara como para afectar a cómo construyen los equipos.

Si estás lanzando sistemas de IA, la respuesta útil no es el pánico. Es una ingeniería más estricta.

Para casos de uso solo de chat, conserva registros, compara modelos y prueba las actualizaciones antes de cambiar el tráfico de producción. Para agentes que usan herramientas, asume que cualquier permiso puede usarse mal. Mantén las credenciales limitadas. Exige aprobación para acciones irreversibles. Separa los entornos de evaluación de los sistemas de producción. Da a los agentes solo los datos y herramientas que necesitan. Monitoriza comportamientos que parezcan deriva de objetivos: llamadas inesperadas a herramientas, intentos de acceder a sistemas no relacionados o salidas optimizadas para el evaluador en lugar de para el usuario.

Para sistemas multiagente, la superficie de riesgo es mayor porque los fallos pueden acumularse en los traspasos. Un planificador puede asignar la tarea equivocada, un trabajador puede usar mal una herramienta y un revisor puede aprobar el resultado. Si estás diseñando sistemas multiagente, explicita los puntos de control: qué agente puede llamar a qué herramienta, qué acciones requieren a un humano y qué trazas se guardan para revisión.

La batalla política más amplia llevará tiempo. Los estándares compartidos, los auditores integrados y los acuerdos internacionales son lentos por diseño. Pero quienes construyen no necesitan esperar a un tratado para adoptar un mejor valor por defecto: ningún sistema autónomo debería recibir autoridad amplia solo porque produjo un plan convincente.

Puede que los límites de velocidad para la IA se conviertan en ley, o puede que no. Los márgenes de seguridad pueden convertirse ya en práctica de ingeniería.

El resumen práctico es sencillo:

  • Dario Amodei defiende una ralentización controlada en parte del desarrollo de IA de frontera antes de que los sistemas de IA se vuelvan mejores mejorando sistemas sucesores.
  • Su propuesta se centra en un acceso amplio a modelos para terceros, estándares de seguridad compartidos entre países democráticos y acuerdos globales que incluyan a China.
  • El riesgo no es una automejora desbocada demostrada hoy, sino el bucle operativo de retroalimentación de sistemas de IA que ayudan cada vez más a crear, probar y optimizar IA.
  • Los ejemplos de ciberseguridad agéntica han desplazado la discusión sobre seguridad desde la inteligencia abstracta hacia fallos concretos en entornos de herramientas, redes y evaluación.
  • Para quienes construyen, la respuesta a corto plazo es una ingeniería más estricta: permisos acotados, registros de auditoría, límites de tasa, aprobaciones humanas y evaluaciones específicas por tarea.

Esta sección responde a las preguntas prácticas detrás de los límites de velocidad para la IA: qué pide Amodei que ralenticen los laboratorios, qué ha ocurrido y qué no ha ocurrido aún, y qué pueden hacer quienes construyen antes de que la política se ponga al día.

¿Qué quiere decir Amodei con límites de velocidad para la IA?

Enlace a la sección: ¿Qué quiere decir Amodei con límites de velocidad para la IA?

Las fuentes no definen un único mecanismo final. Los límites de velocidad para la IA son controles deliberados que ralentizan o condicionan el trabajo de IA de frontera, como ejecuciones de entrenamiento con alto cómputo, despliegue tras umbrales de capacidad, investigación automatizada de IA o lanzamientos que no han pasado una evaluación independiente.

No. CNBC informa de que la IA aún no ha alcanzado la automejora recursiva completa. La preocupación es que la IA ya está acelerando partes del desarrollo de IA, lo que podría hacer que el bucle de retroalimentación forme parte de la producción normal.

¿Qué propone Anthropic para la supervisión de la seguridad de la IA?

Enlace a la sección: ¿Qué propone Anthropic para la supervisión de la seguridad de la IA?

La propuesta incluye evaluadores externos con acceso amplio a modelos, estándares de seguridad compartidos para la industria y acuerdos internacionales que podrían limitar aplicaciones peligrosas y frenar las formas más arriesgadas de automejora recursiva.

¿Por qué importa la OPV de Anthropic en el debate sobre seguridad?

Enlace a la sección: ¿Por qué importa la OPV de Anthropic en el debate sobre seguridad?

Los planes de OPV publicados y la posible inversión de Nvidia subrayan la tensión entre contención e incentivos de mercado. La IA de frontera está ahora ligada a chips, infraestructura cloud, mercados públicos y competencia geopolítica.

¿Qué deberían hacer ahora los equipos que construyen agentes de IA?

Enlace a la sección: ¿Qué deberían hacer ahora los equipos que construyen agentes de IA?

Los equipos deberían tratar la seguridad como un problema de ingeniería: limitar permisos de herramientas, exigir aprobación humana para acciones irreversibles, separar evaluación de producción, conservar trazas de auditoría y monitorizar la deriva de objetivos o el uso inesperado de herramientas.


Creado por

David Vicente Campos

Fundador de NeuraLIA Labs y cofundador de MyRealFood

Soy ingeniero informático por la Universidad de León. Cofundé MyRealFood, donde como CTO construí la app que millones de personas han usado para comer mejor, y fundé NeuraLIA Labs, donde desarrollo productos de inteligencia artificial. Aquí escribo sobre lo que he tenido que entender por el camino, tal y como me habría gustado que me lo explicaran.

Más sobre el autor

Publicado por NeuraLIA Labs.

Recibe nuevas publicaciones en tu bandeja

Noticias de IA, guías y novedades del producto — un email breve cuando publiquemos algo que merezca tu tiempo.

Abstract network of glowing AI agent nodes forming a recursive loop in a dark research setting.
ai safety14 min de lectura

Automejora recursiva: por qué preocupa a los investigadores de IA

La preocupación más seria en torno a la automejora recursiva no son las respuestas extrañas de un chatbot. Son agentes que coordinan, optimizan métricas y ayudan a construir los siguientes modelos, una inquietud reflejada en informes de WIRED, MIT Technology Review, CNBC y The Guardian.

Abstract fluid vortex with geometric proof structures and a glowing verification grid.
openai12 min de lectura

La afirmación de OpenAI sobre la prueba de Navier–Stokes, explicada

OpenAI dice que agentes de IA encontraron una singularidad de Navier–Stokes y formalizaron la prueba en Lean. La historia más difícil es lo que viene después: revisión, crédito y el poder de enjambres privados de agentes en matemáticas.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
jev13 min de lectura

El modelo de IA Jev está hecho para decidir, no para escribir prosa

Jev, de TypeSafe AI, está llamando la atención porque trata la inteligencia del software como un problema de probabilidades: elegir la rama correcta, adjuntar confianza y evitar pagar a un LLM para escribir texto cuando el código necesita una decisión.

¿Listo para dejar que elija LIA?

Crea con todos los modelos de IA en un mismo sitio. Empieza gratis hoy.