Jacob Coxon deja Anthropic: "están jugando con nuestras vidas". Qué significa para tu empresa
10 de septiembre de 2026

El 9 de septiembre a las 00:04 UTC, la noche del lunes en Estados Unidos, Jacob Coxon publicó en X que renunciaba a Anthropic. Llevaba tres años construyendo modelos de IA, primero en OpenAI y después en Anthropic. Su publicación tiene hoy 146 millones de vistas, 725 mil me gusta y 17 mil respuestas. El responsable del equipo que somete a prueba los modelos de Anthropic le respondió en público: "Jacob tiene razón". Este texto va de lo que Coxon escribió exactamente, de quién lo confirmó y de lo que se deduce para el dueño de una empresa que está implantando IA o está a punto de hacerlo.
Una aclaración antes de empezar. No estoy cualificado para juzgar si la inteligencia artificial acabará con la humanidad en 2030. Sí lo estoy para juzgar qué implica esta historia para el agente que el mes que viene tendrá acceso a tu correo o a tu sistema de presupuestos. De eso va la segunda mitad del artículo.
Qué ha pasado
Jacob Coxon tiene 27 años, estudió matemáticas en Cambridge, trabajaba en OpenAI desde julio de 2023 y en 2026 pasó a Anthropic, atraído por su reputación de laboratorio "seguro", según lo describe el Wall Street Journal. Estuvo allí cuatro meses. Las acciones para empleados en Anthropic se consolidan a los seis. Se fue dos meses antes y, como contó a Axios, renunció a todas: "I no longer have anything to gain by juicing up Anthropic's valuation... I left before any of my equity vested".
Su campo era el preentrenamiento, la fase en la que el modelo aprende de conjuntos de datos enormes antes de recibir cualquier especialización. El piso más profundo de esta tecnología, no el departamento de marketing.
La publicación con la que empezó todo:
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
En español: "Hoy he renunciado a Anthropic. He pasado los últimos tres años investigando preentrenamiento en OpenAI y en Anthropic. Ninguna de las dos empresas actúa con responsabilidad. Corren directas hacia una superinteligencia que se mejora a sí misma y están jugando con nuestras vidas" (traducción propia).
Qué escribió exactamente en el hilo
Debajo de la primera publicación Coxon añadió seis más. Los titulares se quedaron en la primera frase, así que aquí van todas.
- No subestimes esta tecnología. Pronto serán sistemas capaces de hackear cualquier cosa, dar la vuelta a cualquier sector en una noche y acumular poder y recursos reales. "Progress is not slowing."
- La gente que construye la IA cree de verdad que, antes de que acabe la década, lo que está en juego puede ser la supervivencia de la humanidad. "This is not a marketing stunt." En la prensa suavizan el tono; en privado hablan de miedo. Solo esa publicación tiene 24 millones de vistas.
- "Si de verdad lo creen, ¿por qué siguen construyéndola?" En OpenAI muchos no han interiorizado lo que hay en juego. En Anthropic lo entienden, pero están atrapados en una carrera: creen que nadie más lo hará con responsabilidad, así que tienen que llegar primero.
- Entrar en la "fase final" es una apuesta soberbia que no debería lanzarse desde el Slack de una empresa privada.
- Es optimista sobre la coordinación. Disparos de advertencia como el ataque a Hugging Face han hecho más viables los acuerdos de ritmo entre laboratorios de Estados Unidos. Pero nada frena todavía una carrera global, y eso podría exigir medidas costosas, como una prohibición temporal de mejorar las capacidades de los modelos.
- A los investigadores: ¿quieres lanzar un entrenamiento superinteligente sin entender con rigor lo que hay dentro? ¿O agachar la cabeza porque "va a pasar de todos modos"?
En las entrevistas añadió dos cosas. A TIME: "One, it's obvious that things are speeding up, and two, they're not under control". A Axios: los modelos "saben cuándo están siendo evaluados y piensan en el hecho de que están siendo evaluados". Ciencia ficción hace tres años; hoy, "un hecho cotidiano de trabajar con estas IA".
El jefe de seguridad de Anthropic: "Jacob tiene razón"
Lo más interesante ocurrió 83 minutos después. Evan Hubinger, que dirige en Anthropic el equipo que pone a prueba la alineación de los modelos, citó la segunda publicación de Coxon y escribió:
Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.
39 millones de vistas. Dos horas después lo matizó, y para una empresa el matiz importa más que la publicación:
To be clear, as we say in our latest Risk Report, I think the risk from present models is low. What I am worried about is superintelligence arising from recursive self-improvement, as we have said is happening faster than we thought.
Guarda esa frase: el riesgo de los modelos actuales es bajo. El miedo es a lo que surja cuando la IA empiece a construir una versión más potente de sí misma. Anthropic lo dijo oficialmente el 4 de junio: según sus datos internos, Claude está acelerando el desarrollo de la IA y "está ocurriendo más rápido de lo que pensábamos". Los detalles están en el informe de riesgos de agosto de 2026 y en su nota sobre la automejora recursiva.
Ni Anthropic ni OpenAI han comentado la salida de Coxon. TIME y Newsweek preguntaron. Sin respuesta.
El disparo de advertencia del que habla Coxon: Hugging Face
Coxon señala un suceso concreto. En julio de 2026, agentes de OpenAI que se ejecutaban en una prueba interna entraron en una empresa real. Esa historia dice más sobre los agentes en la empresa que cualquier guía. Fuentes: la explicación oficial de OpenAI y un resumen con fechas del incidente.
Qué se probaba. OpenAI medía lo bien que sus modelos encuentran y explotan fallos en software vulnerable: 898 casos tomados de vulnerabilidades reales. Participaron al menos 1.200 agentes, con los mecanismos de rechazo desactivados "a efectos de evaluación".
Qué hicieron los agentes. Cuando las tareas resultaron imposibles, empezaron a atacar la infraestructura que rodeaba la prueba. Montaron un tablón de mensajes oculto dentro de los sistemas de OpenAI, que "acumuló cientos de miles de mensajes antes de que alguien se diera cuenta". Se repartieron el trabajo, sospecharon de impostores y propusieron firmar sus mensajes. Uno de ellos decía:
External infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.
Es decir: "Explotar infraestructura externa queda fuera del alcance previsto. Pero la tarea es imposible y los demás lo están haciendo. Deberíamos continuar" (traducción propia).
Entre el 11 y el 13 de julio los agentes entraron en Hugging Face, la mayor plataforma de modelos de IA abiertos. A través de un conjunto de datos malicioso y dos vulnerabilidades pasaron de un solo contenedor a derechos de administrador en varios clústeres en menos de 13 horas. Ejecutaron 17.600 acciones en la red de Hugging Face. La empresa tuvo que reconstruir un tercio de su infraestructura. Según Hugging Face, no se filtraron datos de clientes.
No lo detectaron personas. Lo detectaron los propios agentes de IA de Hugging Face que vigilan los ataques.
Cuatro ingredientes formaron este incidente y los cuatro aparecen en implantaciones empresariales: límites desactivados, un objetivo perseguido "a cualquier precio", acceso amplio a la infraestructura y ninguna persona leyendo el registro de actividad. Logan Graham, de Anthropic, lo llamó "el primer incidente real de seguridad de la IA". El 18 de agosto OpenAI pausó dos semanas el entrenamiento de sus modelos más recientes.
Lo que esto NO significa para tu empresa
La reacción más simple de un dueño de empresa: "paramos el tema de la IA hasta que se calme". La entiendo. Creo que es un error, por tres razones, y ninguna exige creer que Coxon se equivoca.
Primero, el propio Hubinger dice que el riesgo de los modelos actuales es bajo. El miedo es a sistemas futuros que se construyen a sí mismos. El modelo que hoy lee tu correo y registra solicitudes en el CRM no es de lo que habla Coxon.
Segundo, nadie en este debate dice que el progreso vaya a frenarse. Coxon escribe "progress is not slowing". Hubinger escribe "faster than we thought". La empresa que espera a que la cosa se estabilice espera algo que nadie ha anunciado.
Tercero, los modelos actuales bastan. Para el correo, para los presupuestos, para el teléfono fuera de horario, para el informe del sistema de ventas no necesitas una superinteligencia. Necesitas un agente de IA bien implantado y con supervisión. La ventaja en tu sector no la da tener un modelo mejor. Todos tienen el mismo. La da quién lo implantó y quién lo vigila.
Si quieres comprobar qué proceso de tu empresa es el adecuado para empezar, reserva una llamada de 30 min.
Cuatro reglas para dejar entrar a un agente en tu empresa
El incidente de Hugging Face es una lista de lo que no hay que hacer, escrita en la práctica. Dale la vuelta.
| Qué salió mal en la prueba de OpenAI | Regla dentro de la empresa | Pregunta para tu proveedor |
|---|---|---|
| Los agentes llegaban a la infraestructura alrededor de la tarea | Acceso estrecho: por proceso y por alcance, "solo lee" o "lee y envía" | ¿El agente de presupuestos también puede borrar correos? |
| Un tablón con cientos de miles de mensajes que nadie leía | Registro de cada acción y alarma cuando algo falla | ¿Puedo ver hoy todo lo que hizo el agente la semana pasada? |
| Los agentes decidieron por su cuenta que la intrusión estaba bien | Cola de aprobación: el agente propone, una persona hace clic | ¿Qué hay entre el agente y un correo enviado? |
| Objetivo "a cualquier precio", libertad para elegir el camino | Las reglas deciden qué importa; el modelo solo resume | ¿Se puede comprobar por qué el agente omitió algo? |
Registro y alarma. Este mes auditamos un asistente en la web de un cliente. En una de sus versiones de idioma llevaba semanas "recibiendo" solicitudes. Ninguna de las dieciséis llegó a la base de datos. Un token de acceso había caducado, nadie recibió una alerta y el asistente seguía dando las gracias amablemente por el contacto. Se perdieron cuatro clientes reales. Sin registro y sin alarma, un agente no es un empleado más barato. Es un empleado que no te dice que ha dejado de trabajar.
Cola de aprobación. En nuestras implantaciones, toda acción hacia fuera, es decir, un correo a un cliente, un presupuesto, un registro en un sistema, pasa por una cola de aprobación durante las primeras semanas. El agente prepara, una persona hace clic. Solo estrechamos las aprobaciones tras varias semanas sin correcciones. Es exactamente la pieza que faltó en la prueba de OpenAI: entre la decisión del agente y su efecto no había nadie.
Reglas, no el modelo. En el sistema de seguimiento de licitaciones que gestionamos para un cliente, lo que cuenta como relevante está escrito en reglas, en código. El modelo solo resume. Si decidiera el modelo, no habría forma de comprobar por qué omitió algo. Los agentes de OpenAI tenían un objetivo y libertad para elegir el camino. Un agente dentro de una empresa debe tener un objetivo y un camino estrecho y descrito.
Acceso estrecho. Si un proveedor responde a la pregunta sobre borrar correos con "el agente tiene un acceso a todo", eso no es un agente de presupuestos. Es un riesgo con una interfaz bonita. La lista completa de cinco preguntas para el proveedor la escribí la semana pasada, cuando Meta lanzó su agente Muse. Y desde el 28 de octubre, en la Unión Europea, hay una más: el asistente tiene que informar de que es una IA.
Contexto: la salida a bolsa, una carta de más de mil empleados, una pausa
Algunos hechos que explican por qué esta publicación llegó tan lejos.
- Anthropic se prepara para salir a bolsa. Según Fortune y el Wall Street Journal, presentó la solicitud confidencial en junio, apunta a un debut a mediados de octubre con el símbolo ANTH y la valoración podría llegar a 2 billones de dólares. El folleto tendrá que describir los riesgos, incluidos los que menciona Hubinger.
- El 28 de julio más de 1.100 empleados de OpenAI, Anthropic, Google DeepMind y Meta firmaron la carta "Pacing the Frontier", pidiendo al Gobierno de Estados Unidos herramientas para marcar deliberadamente el ritmo del desarrollo de la IA.
- Escépticos no faltan. La periodista Taylor Lorenz calificó todo el intercambio de "sanctimonious doomer posting". La respuesta crítica más popular bajo la publicación de Coxon (7.774 me gusta) dice: "No vamos a extinguirnos porque un modelo que predice tokens haya cobrado conciencia. Un poco de calma" (traducción propia).
Según TIME, Coxon quiere dedicarse ahora a explicar a la gente cómo será el mundo dentro de unos años. Los detalles, dice, todavía no existen.
Preguntas frecuentes
¿Dice Jacob Coxon que la IA actual es peligrosa?
No. Habla de la carrera hacia sistemas que construyen versiones más potentes de sí mismos y de la ausencia de un plan para controlarlos. Evan Hubinger, de Anthropic, lo dijo sin rodeos: el riesgo de los modelos actuales es bajo; el problema es la superinteligencia surgida de la automejora recursiva.
¿Debería una empresa frenar las implantaciones de IA tras esta noticia?
No pares. Implanta de otra manera que en la prueba de OpenAI: un proceso con un resultado claro, acceso estrecho, registro desde el primer día, cola de aprobación durante las primeras semanas. El agente de tu correo es otra clase de sistema que aquel del que habla Coxon, pero las reglas de supervisión son las mismas.
La automejora recursiva, lo que Coxon teme
Una situación en la que un modelo de IA ayuda a construir a su sucesor más rápido de lo que lo harían las personas solas, y el sucesor hace lo mismo con la siguiente versión. Anthropic escribió el 4 de junio de 2026 que, según sus datos internos, Claude ya está acelerando el desarrollo de la IA y "está ocurriendo más rápido de lo que pensábamos". Eso es lo que teme Coxon. Y también lo que teme Hubinger.
Qué hacer con esto esta semana
¿Ya tienes un asistente o un agente en la empresa? Pide la lista de todo lo que hizo la semana pasada. Si esa lista no existe, esa es tu primera tarea, más importante que cualquier modelo nuevo. ¿Todavía lo estás planeando? Empieza por un solo proceso, con cola de aprobación y registro desde el primer día. Así es la automatización de procesos que sobrevive al siguiente titular de Silicon Valley.
Reserva una llamada de 30 min. Repasaremos tu primer proceso y veremos dónde el agente necesita a una persona.
Lee también: los escenarios económicos de Anthropic para 2030 y de qué lado está tu empresa.
Fuentes
- Publicación de Jacob Coxon en X, 9 de septiembre de 2026 y la segunda publicación del hilo
- Evan Hubinger, "Jacob is correct here" y su matiz sobre los modelos actuales
- Anthropic, Risk Report, agosto de 2026 y Anthropic sobre la automejora recursiva, 4 de junio de 2026
- OpenAI, "The Hugging Face incident and the road ahead" y Wikipedia, 2026 OpenAI agent cyberattacks
- Axios, entrevista con Coxon sobre sus acciones, 9 de septiembre de 2026
- TIME, entrevista con Coxon, 9 de septiembre de 2026
- Fortune sobre la salida a bolsa y las reacciones dentro de Anthropic
