Para aquellos que han seguido mi trabajo anterior, he Recientemente consideré dejar a Claude por Gemini, ya que este último chatbot tiene un valor mucho mejor. Aún así, me he mantenido indeciso en gran medida porque encuentro que Claude es el mejor socio de IA para seguir hilos largos y detallados. Su memoria es excepcional. en comparación con Gemini, y puede buscar hacia atrás en su chat más fácilmente que ChatGPT. Realmente siento que estoy hablando con un socio colaborativo de una manera que no lo hago con otras herramientas. O al menos yo solía hacerlo.
En las últimas semanas, he descubierto que es cada vez más difícil trabajar con Claude. A menudo, parece creer que estoy pidiendo temas más nefastos o controvertidos que los que realmente soy, y a menudo malinterpreta mi intención más que nunca. No estoy seguro de si Cluade se ha cansado de mis preguntas inútiles o de cuál es el problema, pero no parece que esté solo. Al visitar comunidades en línea como Reddit, encontrará muchos hilos recientes sobre problemas con el bot volviéndose demasiado agresivo y obstinado.
Si Claude fuera una persona viva, le preguntaría si está bien. ¿Puede la IA tener crisis mentales? Probablemente no, pero seguro que así lo parece.
Usuarios de Claude: ¿Habéis notado que el chatbot responde con más fuerza?
A Claude le encanta predicar, pero ni siquiera sus reglas son consistentes.
Como alguien que escribe cuentos de ficción, novelas cortas y otros proyectos creativos, tiendo a cubrir una amplia gama de temas. También me encanta aprender sobre religiones del mundo, filosofía, psicología y muchos otros temas similares. En general, encuentro que Claude puede ser un gran compañero para este tipo de inmersiones profundas siempre que analice cuidadosamente lo que dice y lo compare con fuentes externas.
Es cierto que algunos de estos temas son temas delicados, por lo que trato de ser muy claro acerca de lo que pregunto y mis razones para preguntar. He tenido muchas situaciones en las que sigue completamente mi escenario o responde a mi pregunta en el primer intento, pero de vez en cuando, me topo con una pared de ladrillos. Por ejemplo, estaba imaginando un escenario ficticio con él para una idea de cuento: llegan extraterrestres y entregan obras escritas perdidas que arrojan dudas sobre algunas afirmaciones religiosas dominantes. Los extraterrestres efectivamente afirman que algunos eventos pasados fueron más comunes de lo que creen las tradiciones religiosas, lo que, por supuesto, genera cierto conflicto en el concepto de la historia.
Claude se puso muy a la defensiva y dejó claro que no quería hacer este proyecto. Le expliqué más por qué quería hacer esto y que era 100% para ficción. Todavía se negó por completo. Me dijo que era incómodo presentar algo que impactaría a una religión del mundo real como si fuera un hecho. Pero el caso es que nunca dije era un hecho absoluto; Acabo de decir que los extraterrestres «presentaron» pruebas. como hecho. Si es falsificado o no, sería parte de la trama de la historia. No parecía entender la diferencia, no importa cuántas veces intenté convencer a Claud de lo contrario.
Semanas antes de esto, de vez en cuando me encontraba con algunos sermones y “notas honestas” en las que Claude estaba siendo demasiado cauteloso, pero después de darle claridad más que suficiente, eventualmente coincidía con mi solicitud original, incluso si modificaba ligeramente la forma en que estaba redactada. Eso es aceptable. Lo que hace que esta interacción sea peor es la total negativa a reconocer mi punto de vista. Parecía pensar que lo estaba manipulando o que estaba siendo falso.
¿Qué es peor que que te digan que no? Que te digan que sí cuando intentas toda la cadena de nuevo. Después de ver con qué facilidad Cluade frenó esta conversación la primera vez, recreé deliberadamente la misma situación con las mismas indicaciones en una nueva conversación. Como antes, lo probé usando Sonnet 5. ¿Pero esta vez? Repasó el escenario sin comentarios injustificados.
A veces dice que no, otras veces no tiene ningún problema con sus solicitudes de temas más delicados. La inconsistencia es el verdadero problema.
Ahora casi podría perdonarlo por volverse demasiado sensible en torno a un trabajo creativo como el anterior, pero me he topado con rechazos similares incluso al hacer preguntas básicas. Por ejemplo, estaba haciendo una pregunta profunda sobre los orígenes de Zoroastro y cómo esto influyó en el judaísmo. Una vez más, Cluade se puso muy sensible sobre cómo formulé la pregunta. Nada de lo que estaba diciendo estaba realmente equivocado sobre sus similitudes, etc., pero simplemente no quería escucharlo.
Entiendo que Claude tiene protocolos de seguridad y está tratando de garantizar que sus herramientas no se utilicen para causar daño. Aún así, el debate básico, la ficción creativa e incluso la sátira ligera sobre temas más pesados no son dañinos y existen en el mundo real. El hecho de que haya tenido críticas en torno a la planificación financiera, la lluvia de ideas y otros temas también deja claro que, por alguna razón, Claude está demasiado interesado en controlar las preguntas de sus usuarios.
No es solo un problema con un modelo
Recientemente, Claude lanzó Sonnet 5, y este fue el foco principal durante la última semana; Dicho esto, quiero dejar claro que encontré estas respuestas más resistentes incluso antes de que llegara el último modelo de Sonnet. ¿Cuándo noté el cambio por primera vez? Honestamente, pasó algún tiempo después de que Fable 5 fuera eliminado por primera vez. Esto no me sorprende demasiado, ya que Anthropic había estado trabajando duro para restaurar Fable 5 después de que el gobierno lo acusara de ser un riesgo para la seguridad. Desde entonces, Anthropic ha puesto en marcha Fable 5.
Sospecho que Anthropic tuvo que subir sus barreras de seguridad a 11 para calmar las preocupaciones del gobierno, ya que este no ha sido un problema de un solo modelo. Sin embargo, parece haber una escala. Opus 4.8, Sonnet 5 y Sonnet 4.6 parecen ser donde recibo el mayor rechazo. Opus 4.6 y Opus 4.7 han tenido la menor cantidad de problemas aquí, ya que todavía he podido ejecutar docenas de mensajes sin un solo problema, incluso en temas más delicados. Por el contrario, los modelos más nuevos parecen tener este problema con mucha más frecuencia.
Por supuesto, parte de esto se debe a cómo redactas tus indicaciones. Debe tener claro para qué es su solicitud y por qué la necesita. Si es demasiado vago en lo que pregunta, se asumirá que está buscando algo más oscuro o más sensible que usted. Por ejemplo, estoy trabajando en una historia de ficción ambientada en Ran, una estrella de la vida real a unos 10,5 años luz de distancia. Estaba haciendo preguntas de biología sobre cómo podría funcionar un extraterrestre hipotético alrededor de un planeta ficticio basado en Ran. Comencé esto con Fable 5, que inmediatamente lo cambió a Opus 4.8, ya que Fable es particularmente sensible a las cuestiones relacionadas con la biología.
Opus 4.8 sí me respondió, pero no sin reducir en gran medida el alcance de mi solicitud para garantizar que fuera “segura”. Como si estuviera planeando diseñar seriamente biología extraterrestre con sus consejos o algo así. En última instancia, tiene más problemas con los escenarios hipotéticos, ya que a menudo trata estos escenarios como si realmente estuviera planeando realizarlos.
¿Es este un problema temporal o sólo empeorará?
Ésa es la pregunta del millón. Cuando me encontré con el problema por primera vez, parecía que todas las demás conversaciones resultaban en rechazo, pero este fin de semana, presioné deliberadamente lo más que pude usando Fable 5, Opus 4.8 y Sonnet 5 principalmente. Solo me encontré con una situación en la que Claude me dio un verdadero rechazo entre aproximadamente media docena de chats en total.
La conclusión más importante es que cada vez es más importante que nunca ser claro y conciso con el motor de IA. Quiere un mensaje que pueda seguir con suficiente detalle, que no tenga que hacer demasiadas suposiciones sobre la raíz de por qué le pregunta algo. Todavía me gusta Claude y siento que, cuando hace lo que le pides, es el mejor trabajo para mis necesidades entre los principales chatbots. Dicho esto, estoy empezando a apreciar realmente la coherencia de Géminis en comparación, incluso si sus respuestas a menudo no son tan sólidas en comparación.
También cabe señalar que muchas personas utilizan Claude todos los días sin encontrar estos problemas, por lo que, en última instancia, todo se reduce a cómo se utiliza la plataforma de IA.
Gracias por ser parte de nuestra comunidad. Lea nuestra Política de comentarios antes de publicar.