vllm-omni-multimodal

Orchestrate multimodal reasoning and generation across text, image, audio, and video inputs.

84|27|Updated Mar 3, 2026
One-click install
npx skills add https://github.com/hsliuustc0106/vllm-omni-skills --skill vllm-omni-multimodal
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill.
Skill: vllm-omni-multimodal
Source: https://github.com/hsliuustc0106/vllm-omni-skills/tree/main/skills/vllm-omni-multimodal
Command: npx skills add https://github.com/hsliuustc0106/vllm-omni-skills --skill vllm-omni-multimodal

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

End-to-end multimodal AI workloads often require separate tools for text, image, audio, and video processing. This skill unifies those capabilities under one Omni-model workflow to simplify development and inference.

Core Features & Use Cases

  • End-to-end multimodal reasoning and generation across text, image, audio, and video inputs using Qwen Omni models.
  • Quick-start examples for offline and online deployment and multi-turn conversations.
  • Supports multiple model variants with different VRAM requirements and serving modes.

Quick Start

Initialize an Omni session with a Qwen-Omni model and ask a text question to begin a multi-modal conversation.

Frequently Asked Questions about vllm-omni-multimodal

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I run multimodal AI inference across text, image, audio, and video?▼

Unified Omni models enable multimodal AI inference across text, image, audio, and video inputs. This skill orchestrates end-to-end reasoning and generation for interactive chat and content analysis tasks.

What is the best way to deploy an omni-model for serving multimodal requests?▼

Deploying an omni-model for serving multimodal requests is supported through both offline and online options. The skill provides quick-start examples and model configuration guidance for serving.

How does multimodal reasoning work for analyzing video and audio inputs?▼

Multimodal reasoning for video and audio inputs works by passing media directly to the Omni model. The model transcribes speech from video and describes images while answering contextual questions.

Do I need specific hardware to run different omni-model variants?▼

Running different omni-model variants requires specific hardware based on VRAM requirements. The skill supports multiple model variants with different VRAM needs and serving modes.

Can I use a single model for image description and speech transcription?▼

You can use a single Omni model for image description and speech transcription. The skill unifies text, image, audio, and video processing capabilities under one workflow to simplify inference.