- Anthropic está lanzando un par de sus modelos más potentes hasta la fecha con Claude Fable 5 y Mythos 5.
- Si bien Mythos 5 está diseñado para permitir que los investigadores de seguridad descubran vulnerabilidades, el público Fable 5 tiene salvaguardias para evitar la piratería.
- Ambos modelos muestran capacidades avanzadas para abordar incluso tareas analíticas muy complejas.
A estas alturas, es casi seguro que hayas visto al menos una demostración de IA que te haya dejado un poco fuera de lugar: «Eso no sólo es bueno; es aterradoramente bien.» Ya sea que hablemos de que la IA robe trabajos a los artistas o genere pruebas novedosas para misterios matemáticos, constantemente encontramos nuevas formas en las que los sistemas impulsados por IA ofrecen resultados que los hacen parecer casi incómodamente poderosos. Recientemente, escuchamos a Anthropic compartir sus preocupaciones sobre el lanzamiento de su último modelo Claude Mythos, que es solo un poco demasiado bueno para encontrar vulnerabilidades de software. Hoy, sin embargo, Anthropic comienza a avanzar precisamente con eso.
La búsqueda automatizada de errores no es nada nuevo, y los científicos informáticos han estado utilizando herramientas como fuzzers durante años, inundando el software con entradas aleatorias con la esperanza de causar un problema. Pero la IA representa una amenaza mucho más potente y, a medida que los buscadores de vulnerabilidades como Mythos han evolucionado, sus creadores se han vuelto apropiadamente temerosos de compartir sus modelos más poderosos.
En lugar de dejar que su tecnología se quede acumulando polvo para siempre, hoy Anthropic comparte el compromiso que ha resuelto sobre cómo implementar Mythos de manera responsable y segura. La clave de este enfoque es dividir las cosas en dos modelos separados: Claude Fable 5 y Claude Mythos 5.
Fable 5 es el modelo para el público en general y es una solución con todas las funciones para abordar tareas analíticas. Esto no tiene por qué limitarse a encontrar vulnerabilidades de software: Fable 5 puede ayudar a codificar, tiene potentes herramientas de análisis de visión e incluso puede desarrollar estrategias internas con el tiempo. Según Anthropic, «las capacidades de Fable 5 superan las de cualquier modelo que hayamos puesto a disposición del público».
Pero Anthropic también lo lanza con algunas condiciones. Fable 5 está diseñado para resistir los intentos de usarlo para encontrar el último exploit de día cero, listo para ser aprovechado por malos actores y causar estragos en los sistemas informáticos globales. Cuando alguien intenta llevar Fable 5 fuera de esos límites, el modelo volverá a Claude Opus 4.8.
Pero luego está Mythos 5, que internamente es igual a Fable 5, pero carece de muchas de esas salvaguardias adicionales. La clave aquí es que Anthropic planea lanzarlo de manera muy selectiva, invitando solo a miembros confiables de la comunidad de ciberseguridad a usarlo. Para adelantarse a los malos, es importante que se utilice una herramienta como esta para identificar errores y corregirlos, y esta solución está destinada a mitigar los riesgos de que Mythos 5 sea reutilizado para ser desagradable.
Anthropic ha desarrollado una serie de «clasificadores» que intentan reconocer lo que los usuarios intentan hacer con Fable 5, y no solo intentan bloquear la piratería. También están diseñados para impedir que alguien utilice el modelo para desarrollar formas de sintetizar compuestos químicos o biológicos peligrosos, o para extraer suficiente información interna para construir su propia Fable 5, sin las salvaguardias establecidas.
Esperemos que esto sea suficiente para mantener esta versión pública basada en Mythos funcionando de manera segura, porque estamos seguros de que mucha gente lo intentará. muy Es difícil desbloquear todas sus capacidades.