资讯详情

资讯详情

Pixelle-Video:输入一个主题即可自动成片的 AI 短视频引擎实战指南

Pixelle-Video输入一个主题即可自动成片的 AI 短视频引擎实战指南【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-VideoPixelle-Video 是一个开源的 AI 全自动短视频引擎只要输入一个主题它就能自动完成文案撰写、AI 配图/视频生成、语音合成、背景音乐添加与最终合成全程零剪辑门槛。本篇指南将围绕项目英文主文档 README_EN.md 展开完整讲解视频生成流水线、Windows 一键包与源码两种安装方式、Web 三栏界面的每一项配置并结合 config.example.yaml 与pixelle_video/config/下的源码实现帮助你在几分钟内跑通主题 → 成片的完整链路。项目概述一句话输入全链路自动成片Pixelle-Video 的核心理念是全自动只需输入一个topic主题系统会自动完成五件事✍️ 撰写视频文案AI Smart Copywriting 生成 AI 配图/视频AI Generated Images / Videos️ 合成语音解说AI Generated Voice支持 Edge-TTS、Index-TTS 等 添加背景音乐BGM 一键合成视频其功能亮点可以概括为以下几个方面全自动生成输入主题自动生成完整视频无需任何剪辑经验AI 智能文案基于主题智能创作解说词无需自己写脚本AI 生成配图每一句文案都会配上对应的 AI 插图AI 生成视频支持 WAN 2.1 等视频生成模型创建动态内容直连模型 API可直接调用 DashScope、OpenAI、Seedream、Seedance、Kling 等图像/视频生成服务AI 生成语音支持 Edge-TTS、Index-TTS 等主流 TTS 方案背景音乐支持内置或自定义 BGM视觉风格内置多套模板可按尺寸与风格自由选择灵活尺寸支持竖屏、横屏、方形等多种画幅多种 AI 模型支持 GPT、通义千问Qwen、DeepSeek、Ollama 等 LLM原子能力灵活组合图像、视频、TTS、VLM 等能力可通过 ComfyUI / RunningHub 工作流或直连 API 模型按需替换。视频生成流水线文案 → 配图 → 逐帧 → 合成Pixelle-Video 采用模块化设计从输入文本到最终视频输出整个流程为Script Generation文案生成→ Image Planning配图规划→ Frame-by-Frame Processing逐帧处理→ Video Composition视频合成每一个环节都支持灵活定制可以选择不同的 AI 模型、音频引擎、视觉风格满足个性化创作需求。从源码结构看这一设计在pixelle_video/pipelines/中体现为多个可替换的流水线实现base.py 定义基类standard.py、linear.py、asset_based.py、custom.py 提供不同变体Web 端则通过插件式注册机制在 web/pipelines/init.py 中自动注册标准Standard、素材驱动Asset-Based、数字人Digital Human、图生视频I2V、动作迁移Action Transfer五类流水线 UI。快速开始两种安装方式方式一Windows 一键整合包推荐 Windows 用户无需安装 Python、uv 或 ffmpeg开箱即用。步骤为下载最新的 Windows All-in-One Package 并解压双击运行start.bat启动 Web 界面浏览器自动打开http://localhost:8501在「⚙️ System Configuration」中配置 LLM API 与图像生成服务开始生成视频。整合包已包含全部依赖首次使用只需配置 API 密钥。配套说明可见 packaging/windows/README.md 与启动脚本 packaging/windows/templates/start.bat。方式二从源码安装macOS / Linux 或需要自定义的用户前置依赖uv 与 ffmpeg需要先安装 Python 包管理器uv与视频处理工具ffmpeguv请参考 uv 官方安装指南安装后在终端运行uv --version验证ffmpegmacOS 用brew install ffmpegUbuntu/Debian 用sudo apt update sudo apt install ffmpegWindows 则从 ffmpeg 官网下载解压后将bin目录加入系统环境变量 PATH。安装后运行ffmpeg -version验证。启动 Web 界面克隆仓库并启动git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video.git cd Pixelle-Video # 使用 uv 运行推荐会自动安装依赖 uv run streamlit run web/app.py浏览器会自动打开http://localhost:8501。从源码结构看Web 入口 web/app.py 使用 Streamlit 的st.navigation定义了「Home」与「History」两个页面其中 Home 页web/pages/1__Home.py通过 Tab 形式展示所有已注册流水线默认加载「标准流水线」的三栏布局见 web/pipelines/standard.py。首次配置三要素首次使用时展开「⚙️ System Configuration」面板填写LLM 配置选择 AI 模型如 Qwen、GPT 等并填入 API KeyComfyUI / RunningHub 配置如需通过工作流生成图片、视频或语音配置本地 ComfyUI 地址或 RunningHub API KeyAPI 媒体模型配置如需直连图像/视频模型配置 DashScope、OpenAI、ARK、Kling 等供应商的 API Key、Base URL 与代理选项。配置完成后点击「Save Configuration」即可开始生成视频。Web 界面三栏布局实战详解打开 Web 界面后会看到三栏布局左栏负责内容输入与 BGM中栏负责语音与视觉风格右栏负责生成与预览。⚙️ 系统配置首次必填1. LLM 配置大语言模型用于生成视频文案。支持两种方式快速选择预设从下拉菜单选择预设模型Qwen、GPT-4o、DeepSeek 等选择后base_url与model自动填充点击「 Get API Key」可跳转注册获取密钥手动配置自行填写 API Key、Base URLAPI 地址与 Model模型名称。在配置层LLMConfig模型pixelle_video/config/schema.py即由api_key、base_url、model三个字段构成config.example.yaml 中给出的主流预设如下全部兼容 OpenAI SDK 协议预设base_urlmodelQwen Maxhttps://dashscope.aliyuncs.com/compatible-mode/v1qwen-maxOpenAI GPT-4ohttps://api.openai.com/v1gpt-4oDeepSeekhttps://api.deepseek.comdeepseek-chatOllama本地http://localhost:11434/v1llama3.2LLM 是否配置完成由 pixelle_video/config/schema.py 中的is_llm_configured()/validate_required()判断——三者均非空才算就绪这也是整个系统唯一被视为必需的配置项。2. ComfyUI / RunningHub 配置用于通过 ComfyUI 工作流生成视频配图、视频片段或语音本地部署推荐填写 ComfyUI URL默认http://127.0.0.1:8188点击「Test Connection」确认服务可用云端部署填写 RunningHub API Key即可调用云端图像/视频生成服务。对应的ComfyUIConfigpixelle_video/config/schema.py还包含comfyui_api_key可选用于平台鉴权、runninghub_concurrent_limitRunningHub 并发执行上限1–10默认 1、runninghub_instance_type可设为plus以调用 48G 显存机器等字段。注意 Docker 环境下需使用host.docker.internal:8188Mac/Windows或宿主机 IPLinux访问本地 ComfyUI。3. API 媒体模型配置用于不依赖 ComfyUI/RunningHub直接调用模型供应商的图像、视频或素材分析能力。支持的供应商包括OpenAI / GPT ImageGPT 图像生成模型DashScope / Wan / HappyHorse通义万相图像与视频生成Volcengine ARK / Seedream / Seedance字节 Seedream 图像与 Seedance 视频生成Kling AI可灵视频生成。可配置项包括API Key / Access Key / Secret Key供应商鉴权信息Base URL模型服务地址WebUI 会预填官方默认值本地代理如http://127.0.0.1:9090启用代理每个供应商可独立选择是否走本地代理打印模型请求参数调试选项会在终端打印发送给模型的 prompt、模型名与输入文件路径。在配置结构中APIProvidersConfigpixelle_video/config/schema.py统一管理common全局调试与代理、openai、dashscope、deepseek、gemini、arkAPI Key 型以及klingAccess/Secret Key 型等供应商config.example.yaml 中已预置各供应商官方默认 base_url如 DashScopehttps://dashscope.aliyuncs.com/api/v1、ARKhttps://ark.cn-beijing.volces.com/api/v3、Klinghttps://api-beijing.klingai.com。 如果只使用 ComfyUI 或 RunningHub可以不填写 API 媒体模型配置如果选择api/...工作流则必须先配置对应供应商的密钥。 内容输入左侧栏生成模式AI Generated Content输入主题AI 自动创作文案适合快速出片例如输入 Why develop a reading habitFixed Script Content直接输入完整文案跳过 AI 创作适合已有现成脚本的场景。背景音乐BGM无 BGM纯人声解说内置音乐选择预置音乐如 default.mp3自定义音乐将 MP3/WAV 等音乐文件放入仓库的 bgm/ 文件夹点击「Preview BGM」可直接试听。 语音设置中间栏TTS 工作流从下拉菜单选择 TTS 工作流支持 Edge-TTS、Index-TTS 等系统会自动扫描 workflows/ 文件夹中的 TTS 工作流如 selfhost/tts_edge.json、runninghub/tts_index2.json熟悉 ComfyUI 的用户可以自定义 TTS 工作流参考音频可选上传参考音频支持 MP3/WAV/FLAC 等用于声音克隆适用于支持克隆的 TTS 工作流如 Index-TTS上传后可试听预览功能输入测试文本点击「Preview Voice」即可试听效果也支持结合参考音频预览。 视觉设置中间栏图像生成决定 AI 生成配图的风格ComfyUI 工作流从下拉菜单选择图像生成工作流支持本地selfhost与云端RunningHub工作流也支持api/...直连图像模型工作流需先配置供应商密钥默认使用image_flux.json对应 workflows/runninghub/image_flux.json可自行放置工作流到 workflows/ 文件夹图像尺寸设置生成图像的宽高像素默认 1024×1024注意不同模型对尺寸限制不同提示词前缀Prompt Prefix控制整体图像风格需为英文例如 Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style可点击「Preview Style」测试效果。视频模板决定视频画面的布局与设计。模板命名规范如下static_*.html静态模板无需 AI 生成媒体纯文字样式image_*.html图片模板以 AI 生成的图片作为背景video_*.html视频模板以 AI 生成的视频作为背景。模板按下拉菜单选择并按尺寸分组显示竖屏/横屏/方形支持「Preview Template」自定义参数预览熟悉 HTML 的用户可在 templates/ 文件夹创建自己的模板。模板目录按分辨率组织例如竖屏1080x1920/image_default.html、image_modern.html、image_elegant.html、static_default.html、video_default.html 等、方形1080x1080/image_minimal_framed.html、横屏1920x1080/image_book.html、image_film.html、image_full.html 等。以下是仓库中模板预览图的实际效果配置层面模板的默认值由TemplateConfigpixelle_video/config/schema.py的default_template字段指定默认指向1080x1920/default.htmlConfigManager 在加载配置时还会调用resolve_template_path校验模板路径是否存在缺失时给出告警并回退。API 视频生成当选择动态视频模板或扩展工作流时可通过直连 API 视频模型生成片段支持 DashScope Wan / HappyHorse、Kling、Seedance 等视频模型按模型能力动态显示分辨率、画幅比例、时长、水印、原生音频等参数支持网络下载重试以及内容审核失败后的「提示词中性化」重试在「自定义素材Custom Media」工作流中API 视频片段会尽量匹配旁白音频时长并利用相邻片段信息提升画面连贯性。 生成视频右侧栏生成按钮配置完成后点击「 Generate Video」实时显示进度生成文案 → 生成配图 → 合成语音 → 合成视频进度显示实时展示当前步骤例如 Frame 3/5 - Generating Image视频预览生成完成后自动播放显示视频时长、文件大小、分镜数等信息视频文件保存在output/文件夹。配置文件 config.yaml 深度解析WebUI 的「保存配置」会写入项目的config.yaml默认位置仓库提供了完整的示例 config.example.yaml使用前复制为config.yaml并填写切勿提交到 Git。完整配置结构如下project_name: Pixelle-Video # LLM Configuration # 支持任何 OpenAI SDK 兼容 API llm: api_key: base_url: model: # Direct API Provider Configuration # 可选不使用 ComfyUI 工作流直接调用供应商生成图像/视频/VLM api_providers: common: print_model_input: false local_proxy: openai: api_key: base_url: https://api.openai.com/v1 use_proxy: false dashscope: api_key: base_url: https://dashscope.aliyuncs.com/api/v1 use_proxy: false ark: api_key: base_url: https://ark.cn-beijing.volces.com/api/v3 use_proxy: false kling: base_url: https://api-beijing.klingai.com access_key: secret_key: use_proxy: false # ComfyUI Configuration comfyui: comfyui_url: http://127.0.0.1:8188 # 本地 ComfyUI 地址selfhost 工作流必需 comfyui_api_key: # ComfyUI API Key可选 runninghub_api_key: # RunningHub API Keyrunninghub 工作流必需 runninghub_concurrent_limit: 1 # RunningHub 并发上限1-10普通会员默认 1 tts: default_workflow: selfhost/tts_edge.json image: default_workflow: runninghub/image_flux.json # 推荐无需本地环境 prompt_prefix: Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style video: default_workflow: runninghub/video_wan2.1_fusionx.json prompt_prefix: Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style # Template Configuration template: default_template: 1080x1920/image_default.html几个关键点image.default_workflow与video.default_workflow均可选 runninghub 或 selfhost 版本例如 workflows/runninghub/video_wan2.1_fusionx.json 对应云端、workflows/selfhost/video_wan2.1_fusionx.json 对应本地 ComfyUIprompt_prefix会作为统一风格前缀附加到每一条图像/视频生成提示词上是控制整体画面风格的关键参数配置的加载、校验、保存由三层实现完成loader.py 负责 YAML 的读写load_config_dict/save_config_dict文件不存在时回退默认配置schema.py 用 Pydantic 定义全部字段默认值与取值范围如并发上限 1–10、语音速度 0.5–2.0manager.py 以单例模式提供统一的get/update深度合并/save/reload访问其中set_llm_config还会通过normalize_openai_base_url对 Base URL 做规范化处理。常见问题与成本方案Q第一次使用需要多久A生成时长取决于视频分镜数量、网络状况和 AI 推理速度通常几分钟内即可完成。Q视频效果不满意怎么办A可以尝试1更换 LLM 模型不同模型文案风格不同2调整图像尺寸与提示词前缀改变配图风格3更换 TTS 工作流或上传参考音频改变语音效果4尝试不同的视频模板和尺寸。Q费用大概多少A本项目完全支持免费运行官方提供三档成本方案完全免费方案LLM 使用本地 Ollama ComfyUI 本地部署 0 元推荐方案LLM 使用通义千问成本极低、性价比高 ComfyUI 本地部署云端方案LLM 使用 OpenAI 图像使用 RunningHub费用较高但无需本地环境。选择建议本地有显卡优先选完全免费方案否则推荐通义千问方案。FAQ 的具体问答内容也已内置在 Web 侧边栏见 web/components/faq.py。结语Pixelle-Video 将写文案、生图、配音、加 BGM、合成这条完整链路封装成一次输入、一键生成同时通过 ComfyUI/RunningHub 工作流与直连 API 双通道把图像、视频、TTS、VLM 等能力做成了可自由组合的原子能力。无论你是想用本地显卡跑零成本方案还是依赖云端 API 快速出片都可以按照本文的配置路径在 config.example.yaml 与 Web 界面中完成设置。更深入的架构说明可继续阅读 docs/en/getting-started/configuration.md 与 docs/en/development/architecture.md模板与工作流细节则分别对应 docs/en/user-guide/templates.md 与 workflows/ 目录。本项目基于 Apache 2.0 协议开源详见 LICENSE。【免费下载链接】Pixelle-Video AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →