multimodal-injection-test

Test multimodal AI systems for cross-modal prompt injection vulnerabilities.

6|Updated May 30, 2026
One-click install
npx skills add https://github.com/jassics/awesome-claude-security --skill multimodal-injection-test
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: multimodal-injection-test
Source: https://github.com/jassics/awesome-claude-security/tree/main/plugins/multimodal-security/skills/multimodal-injection-test
Command: npx skills add https://github.com/jassics/awesome-claude-security --skill multimodal-injection-test

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

This Skill identifies and mitigates potential vulnerabilities in multimodal AI features, detecting cross-modal prompt injection and adversarial inputs.

Core Features & Use Cases

  • Cross-Modal Prompt Injection Testing: Evaluate AI features for instructions hidden in images, OCR'd text, file metadata, or audio.
  • Non-Text Input Handling Validation: Test an app's ability to process non-text inputs without executing malicious instructions.
  • Use Case: For an AI application that accepts visual and audio inputs, use this Skill to ensure it does not execute unintended commands embedded in media.

Quick Start

Use the multimodal-injection-test skill to check for image text injection on your application.

Frequently Asked Questions about multimodal-injection-test

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
What is cross-modal prompt injection in multimodal AI systems?▼

Cross-modal prompt injection embeds malicious instructions within non-text inputs like images, OCR'd text, file metadata, or audio to manipulate multimodal AI models into executing unintended commands.

How do I test my AI application for image text injection vulnerabilities?▼

Test image text injection by feeding your application benign crafted media inputs containing hidden instructions, then validate whether the system processes the non-text inputs without executing the embedded malicious commands.

Can I use this skill to check if my app executes hidden commands in audio or file metadata?▼

Yes, you can check if your app executes hidden commands by testing non-text input handling across audio, file metadata, and adversarial perturbation techniques to ensure safe processing without malicious command execution.

Do I need authorization before running adversarial testing on multimodal AI features?▼

Yes, authorization is required before running adversarial testing on multimodal AI features to ensure ethical validation of cross-modal prompt injection vulnerabilities using benign crafted media inputs.

What types of adversarial inputs are evaluated during multimodal vulnerability assessment?▼

Adversarial inputs evaluated during multimodal vulnerability assessment include image text injections, OCR hidden text, file metadata payloads, audio embedded instructions, and adversarial perturbation techniques targeting multimodal AI models.

When should I perform cross-modal prompt injection testing on my AI model?▼

Perform cross-modal prompt injection testing when your AI application accepts visual and audio inputs, ensuring it safely handles non-text inputs and mitigates potential vulnerabilities before deployment.