← Volver al artículo

Transparencia

Anthropic publica guía oficial y declara a Claude Opus 4.5 robusto frente a prompt injections

Afirmaciones verificadas

  • Anthropic publica una guía oficial sobre mitigación de prompt injections en Claude Platform Docs, donde define que ‘jailbreaking and prompt injection are attempts to make Claude ignore its guidelines or your instructions’.

    Estado: Verificada (fuente primaria)

  • Anthropic también mantiene una página de ‘Transparency Hub’ donde afirma que prevenir prompt injection es una prioridad y define el concepto como ‘a malicious instruction hidden in tool results that an agent processes during a task’.

    Estado: Verificada (fuente primaria)

  • El post oficial de Anthropic sobre defensas frente a prompt injection en browser use, fechado el 2025-11-24, donde afirma que ‘Claude Opus 4.5 sets a new standard in robustness to prompt injections’.

    Estado: Verificada (fuente primaria)

  • En ‘Claude hallucinated its own internal tools…’ los comentaristas atribuyen el comportamiento a una exposición accidental de definiciones JSON de herramientas internas y especulan que Anthropic estaría enviando una función pensada para Opus 4.8 a modelos ‘.6’.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • En ‘Claude sent me prompt injection?!’ los participantes sostienen que Claude no fue ‘hackeado’ sino que estaba interpretando una inyección y respondiendo a ella.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Un hilo de r/ClaudeAI ‘Prompt Injection’ contiene opiniones contrapuestas: una persona dice que sí parece un intento de prompt injection y otra responde que no parece tal caso.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Un hilo de r/ClaudeAI titulado ‘Umm….. this is happening to me right now. Respectfully, what on earth?’ sostiene que el usuario habría sufrido un prompt injection attack.

    Estado: Atribuida a una sola fuente · Requiere atribución