首个支持端到端多模态交互的 ComfyUI 插件。集成 Qwen2.5-Omni 多模态大模型:在 ComfyUI 框架内无缝联合生成与编辑文本、图像、音频与视频。关键特性:双模式 Omni(Qwen2.5-Omni-3B 与 7B)、多模态输入(文本提示词、图像、音频文件与视频帧)、统一输出生成(连贯文本描述与高质量语音合成)、参数化控制(可调温度、最大 token、采样策略)、GPU 优化(低内存环境 4/8 位量化)、跨模态编辑(跨媒体类型修改内容)。同时处理多种输入模态,带来前所未有的 AI 内容创作能力——从创意写作到配音与视觉编辑。适合探索多模态 AI 前沿的艺术家、开发者与研究者。
https://github.com/SXQBW/ComfyUI-Qwen-Omni
git clone https://github.com/SXQBW/ComfyUI-Qwen-Omni
comfy node install ComfyUI-Qwen-Omni
为 DIT 模型设计的简单逻辑神奇放大节点工作流。通用适用于 Flux、Hunyuan、SD3:把初始图像简单平铺成碎片,再用 image-interrogator 为每图块获取提…
立体 3D 工具包:基于深度立体生成 + GPU 加速、PyOpenXR 原生 VR 观看与 AI 驱动 StereoDiffusion。支持 6+ 立体转换模式、VR 头显观看与…
精简常见工作流的节点集。——一体化模型加载器:checkpoint、LoRA、CLIP、VAE;GGUF 量化模型支持:FLUX、FLUX2、SDXL、SD3.5;FLUX、SDX…