AutoClip:用字幕分析自动生成高光切片与短视频合集
一个把访谈、播客和课程字幕变成高光短片的工具,还能用Ollama本地分析并通过CLI/MCP自动化。
GitHub zhouxiaoka/autoclip 更新 2026-09-22 分支 main 星标 8.2K 分叉 1.6K
Python TypeScript FFmpeg Whisper Ollama Docker CLI/MCP 视频剪辑

🧭 决策指南

适合,如果你

  • 你要把访谈、播客、课程或直播回放批量变成短片
    README“你可以做什么”列出访谈、播客、课程和直播回放,并提供CLI批量编排
  • 你希望用Ollama和qwen2.5:7b避免云端API Key
    README“模型配置”和“常见问题”说明Ollama本地预设无需云端Key,默认模型为qwen2.5:7b
  • 你需要Docker Web界面或支持MCP的客户端接入处理流水线
    README“Docker / Web”和“CLI / MCP”分别提供localhost:3000、API文档和autoclip mcp

不适合,如果你

  • 你的素材主要是纯视觉动作或音乐类视频
    README“常见问题”明确说明当前分析主要基于字幕,此类视频效果可能有限
  • 你不能接受字幕文本发送到云端模型服务商
    README“常见问题”说明使用云端模型时字幕文本会发送给该服务商
  • 你需要即时客服或一对一部署支持
    README“参与贡献与联系”说明项目为个人业余维护,不提供即时客服或一对一部署服务

前置条件

  • {'text': 'CLI需要Python 3.10+(建议3.11)和PATH中可用的FFmpeg', 'text_en': 'The CLI requires Python 3.10+ (3.11 recommended) and FFmpeg available in PATH'}
  • {'text': 'Docker部署需要Docker和Docker Compose v2', 'text_en': 'Docker deployment requires Docker and Docker Compose v2'}
  • {'text': '无字幕视频需要faster-whisper及语音模型;Ollama需先启动并下载模型', 'text_en': 'Videos without subtitles require faster-whisper and a speech model; Ollama must be started and its model downloaded'}
  • {'text': 'Windows桌面版支持Windows 10/11 x64,macOS安装包为Apple Silicon', 'text_en': 'The desktop release supports Windows 10/11 x64 and provides a macOS Apple Silicon package'}

第一步命令(README 原文)

docker compose up -d --build

要注意

  • Docker绑定目录报权限错误时,要用root修正/app/data、/app/logs和/app/uploads
    README“Docker / Web”给出了docker compose run --rm --no-deps --user root命令
  • 生成失败要检查字幕、模型连接、评分阈值、FFmpeg和磁盘
    README“常见问题”列出失败阶段检查项,并提到可将评分阈值从0.7降到0.5
  • Docker中的localhost不等于宿主机,访问Ollama需配置可达的宿主机地址
    README“模型配置”明确说明Docker访问宿主机模型服务时localhost指向容器自身
  • 云端模型只分析字幕,但下载视频与模型仍需要网络
    README“模型配置”说明云端发送字幕文本,下载视频与模型仍需要网络

材料未说明

  • README没有给出支持的视频编码、容器格式和最大视频时长
  • README没有给出Ollama或faster-whisper所需的最低CPU、GPU、内存和磁盘规格
  • README没有提供不同模型、视频时长与硬件组合下的处理耗时或输出质量数据
  • README没有说明统计与错误报告的具体字段、默认开关和数据保留期限
  • README没有量化YouTube、B站、本地视频和SRT字幕的失败率或识别准确率

💡 深度解析

6
适合 我用 Python 3.11 和 FFmpeg 批量处理直播回放,不能依赖桌面界面;我能否用 AutoClip CLI 输出 JSON,再由 MCP 客户端继续编排 Shorts 导出?
适合读者: 需要批量处理长直播回放、使用 Python 3.11 和 FFmpeg,并希望通过 CLI/MCP 接入自动化流水线的开发者

适合,因为 README 为 Python 3.10+ 环境提供了 CLI,并明确支持 JSON 结果、批量编排和 stdio MCP 服务。

  • CLI 要求 Python 3.10+,建议 3.11,且 PATH 中必须有 FFmpeg;CLI 本地处理不需要 Redis。
  • autoclip run ... --json 可输出处理结果,随后用项目 ID 执行 autoclip export PROJECT_ID --preset shorts
  • autoclip mcp 会启动 stdio MCP 服务,支持 MCP 的客户端可以调用同一条处理流水线。
  • README 将 CLI 描述为批量编排入口,适合把分析、片段生成和平台预设导出纳入脚本流程。

这满足“不使用桌面界面、保留机器可读结果并接入代理”的约束。不过 README 没有给出批量任务队列、失败重试、幂等规则或长视频资源上限,工程化编排仍需自行设计。

  • CLI / MCP:需要 Python 3.10+(建议 3.11)和 PATH 中可用的 FFmpeg;CLI 本地处理不需要 Redis
  • 快速开始:autoclip run talk.mp4 --provider ollama --json
  • 快速开始:autoclip export PROJECT_ID --preset shorts
  • 快速开始:autoclip mcp;通过 CLI 批量编排,或让支持 MCP 的客户端调用同一条处理流水线
python -m pip install -e .
材料未说明:README 未说明 CLI 是否支持原生并发、任务队列、断点续跑和失败重试。;README 未说明单个项目可处理的最长视频时长、最大文件大小或 JSON schema 的稳定性。
适合 我现有模型服务分别走 OpenAI 兼容接口和 Gemini,播客成片要同时适配抖音、小红书、YouTube Shorts 和 B 站;AutoClip 是否能覆盖模型接入和平台格式导出?
适合读者: 使用 OpenAI 兼容接口和 Gemini 的播客制作人,要求同时导出抖音、小红书、YouTube Shorts 和 B 站版本

适合,因为项目同时覆盖 OpenAI 兼容接口、Gemini 和四类目标平台的导出预设,且支持字幕烧录与标题卡。

  • 模型配置支持通义千问、OpenAI 兼容接口、Gemini 和硅基流动;OpenAI 兼容接口可配置 Base URL。
  • 发布导出明确列出抖音、小红书、YouTube Shorts 和 B 站预设,不需要把平台规格分别交给外部剪辑工具处理。
  • 项目会从字幕生成话题时间线、精彩度评分和片段标题,再自动生成切片与推荐合集,符合播客的口播内容链路。
  • 成片仍属于可编辑初稿,README 提醒需要复核片段起止点、上下文、字幕、标题卡、画幅和平台规范。

因此它能覆盖“模型调用到多平台初版导出”的主流程,但不能据 README 认定它具备平台发布 API、账号管理或自动上传能力。

  • 模型配置:支持通义千问、OpenAI 兼容接口、Gemini 或硅基流动;兼容接口可配置 Base URL
  • 你可以做什么:提供抖音、小红书、YouTube Shorts 和 B 站导出预设,支持烧录字幕与标题卡
  • 你可以做什么:从字幕提取大纲、话题时间线、精彩度评分和片段标题
  • 最佳实践:发布前复核片段起止点、上下文、字幕、标题卡、画幅和平台规范
cp env.example .env
材料未说明:README 未说明四个平台预设的具体分辨率、码率、帧率和时长规则。;README 未说明是否支持各平台官方 API 自动发布、账号授权或发布状态回传。
适合 我维护 macOS Intel 和 Linux 工作站,团队已有 Docker 环境,主要处理访谈和播客回放;AutoClip 能否避开桌面安装包,直接在内网提供 Web 界面和 API?
适合读者: 维护 macOS Intel 和 Linux 工作站、已有 Docker 环境,并希望处理访谈与播客回放的内容生产者

适合,因为 README 明确把 Docker/Web 作为 Intel Mac 和 Linux 的使用路径,并同时提供 Web 界面与后端 API。

  • 桌面安装包只列出 macOS Apple Silicon 和 Windows x64;Intel Mac / Linux 应使用 Docker 或 CLI。
  • Docker 需要 Docker Compose v2,启动后 Web 界面位于 http://localhost:3000,API 文档位于 http://localhost:8000/docs
  • 项目支持本地视频、YouTube 和 B 站链接,也能为访谈、播客、课程和直播回放生成高光、切片与合集。
  • 视频剪辑在本地完成,但如果选择云端模型,字幕文本仍会发送给对应服务商。

因此,它适合内网部署和浏览器操作;但 README 没有说明反向代理、登录认证、并发上限或多用户权限模型,不能据此确认它适合直接作为多租户生产平台。

  • 快速开始:Intel Mac / Linux 使用下方 Docker 或 CLI
  • 快速开始:打开 Web 界面 http://localhost:3000;API 文档 http://localhost:8000/docs
  • 你可以做什么:适合访谈、播客、课程和直播回放
  • 模型配置:视频剪辑在本地进行,云端模型分析会向所选服务发送字幕文本
git clone https://github.com/zhouxiaoka/autoclip.git
材料未说明:README 未说明 Web 服务是否内置用户认证、权限控制和多用户隔离。;README 未说明 Docker 部署的并发处理能力、反向代理配置和内网安全边界。
视情况 我只有没有字幕的直播回放,使用 Windows 10/11 x64 笔记本,也不想购买云端 API Key;AutoClip 能否从本地转写开始完成高光提取?
适合读者: 只有无字幕直播回放、使用 Windows 10/11 x64 笔记本、希望不购买云端 API Key 的视频运营人员

视情况:Windows x64、Ollama/LM Studio 和本地 Whisper 路径都存在,但无字幕处理会增加安装、模型下载和硬件负担。

  • README 提供 Windows 10/11 x64 安装包,桌面版内置 Python 和 FFmpeg。
  • 没有字幕时可以安装 faster-whisper 并下载语音模型;这一步完全发生在本地,但首次转写可能耗时较长,并受语言、口音和音频质量影响。
  • Ollama / LM Studio 本地预设无需云端 Key,但仍需要模型和相应硬件;README 没有给出 Windows 笔记本的最低配置。
  • 项目主要基于字幕分析,适合口播、访谈、播客、课程和直播回放;若直播以游戏画面、音乐或纯视觉动作密集为主,支持可能有限。

所以它能满足“不买云端 Key”的部署方向,但是否适合这台笔记本以及这类直播内容,取决于本地硬件、语音清晰度和直播的语言结构。

  • 快速开始:Windows 10 / 11 · x64;桌面安装包内置 Python 和 FFmpeg
  • 常见问题:没有字幕时需要先准备本地 Whisper 组件和语音模型
  • 常见问题:Ollama / LM Studio 本地预设无需云端 Key,但需要模型和相应硬件
  • 常见问题:当前分析主要基于字幕,适合访谈、播客、课程和口播;纯视觉动作或音乐类视频效果可能有限
python -m pip install faster-whisper
材料未说明:README 未说明 faster-whisper 在 Windows x64 笔记本上的 CPU/GPU 最低配置和实际转写速度。;README 未说明本地语音模型与本地 LLM 的总磁盘占用及显存需求。
视情况 我用 Ollama 的 qwen2.5:7b 处理包含客户信息的课程视频,不能把字幕发送到云端;AutoClip 能否在本地完成分析、剪辑和 Shorts 导出?
适合读者: 使用 Ollama 和 qwen2.5:7b、不能把课程字幕发送到云端的知识博主

视情况:本地模型和本地视频处理路径是支持的,但能否达到可接受的分析质量取决于 qwen2.5:7b、字幕质量和本机硬件。

  • README 给出了 Ollama 预设,默认地址为 http://localhost:11434/v1,默认模型为 qwen2.5:7b,且无需云端 API Key。
  • 项目在本地完成视频剪辑;使用本地 Ollama 时,README 没有要求把字幕发送给云端服务商。
  • 没有字幕的视频还需要安装 faster-whisper 并下载语音模型,转写会增加本地计算、下载和存储要求。
  • CLI 可用 --json 生成处理结果,再用 Shorts 预设导出;但本地模型的硬件要求、处理速度和质量下限未被 README 量化。

所以它符合“数据不出本机”的架构约束,但不等于保证课程内容能稳定识别或达到云端模型的语义效果。

  • 模型配置:Ollama 服务地址默认为 http://localhost:11434/v1,默认模型 qwen2.5:7b,无需 API Key
  • 常见问题:本地剪辑在你的设备上完成
  • 快速开始:无字幕视频需要 faster-whisper,首次转写会下载语音模型
  • 快速开始:autoclip run talk.mp4 --provider ollama --json;autoclip export PROJECT_ID --preset shorts
ollama pull qwen2.5:7b
材料未说明:README 未说明 qwen2.5:7b 在不同字幕长度、语言和硬件上的准确率与吞吐量。;README 未说明本地模型是否支持课程中的专业术语、说话人区分或复杂上下文。
视情况 我需要把工具集成到 MIT 许可的开源工作流中,处理客户访谈和课程素材,并要求界面支持中英日韩等语言、敏感字幕尽量不出本机;AutoClip 是否满足这些限制?
适合读者: 负责客户访谈与课程素材的个人业余维护开源工具集成者,要求 MIT 许可、支持多语言界面,并担心数据合规

视情况:许可证和多语言界面符合要求,本地剪辑与本地模型也能降低数据外发,但使用云端模型时字幕仍会离开本机。

  • 项目数据标注为 MIT License,README 也明确写明 AutoClip 免费、开源(MIT),适合作为开源工作流的组成部分。
  • v1.3.1 起界面、官网和 README 支持中、英、日、韩、西、葡、俄、法;用户素材和生成内容保留原文。
  • 本地视频剪辑在设备上完成,Ollama 和 LM Studio 可作为本地模型选项,因此可以构建较少外传数据的路径。
  • 但选择云端模型时,字幕文本会发送给服务商;主动使用发布上传功能时,视频还会发送到目标平台。

所以它满足“MIT + 多语言 + 可本地化处理”的产品约束,却不能在使用云端模型或平台上传时保证敏感数据完全留在本机。README 也提醒 README 翻译语言不等于转写模型或素材语言支持范围。

  • 项目核心数据:license 为 MIT License
  • README:自 v1.3.1 起,产品界面、官网和 README 均支持中、英、日、韩、西、葡、俄、法
  • 常见问题:本地剪辑在你的设备上完成;使用云端模型时,字幕文本会发送给该服务商
  • 文档:README 翻译语言不代表应用界面或转写模型支持的语言范围
材料未说明:README 未说明 MIT 之外的第三方模型、FFmpeg、Whisper 和前端依赖的许可证组合。;README 未给出各转写模型实际支持的语言清单、数据保留期限或云端服务商的合规认证。

✨ 核心亮点

  • 支持本地视频、YouTube、B站与SRT字幕导入
  • 可用Ollama运行qwen2.5:7b本地模型
  • 同时提供桌面版、Docker Web与CLI/MCP
  • 支持抖音、小红书、YouTube Shorts导出预设

🔧 工程化

  • AI从字幕提取大纲、话题时间线、精彩度评分和片段标题
  • FFmpeg自动生成视频切片、合集,并支持字幕与标题卡
  • 通过autoclip run和autoclip mcp接入批处理与MCP客户端

⚠️ 风险

  • 分析主要基于字幕,纯视觉动作或音乐类视频效果可能有限
  • 云端模型会向所选服务商发送字幕文本并产生服务费用
  • 无字幕视频需faster-whisper与语音模型,首次转写会下载模型
  • Docker访问宿主机模型时,localhost指向容器自身
  • 个人业余维护,回复时间不固定且不提供即时客服

👥 适合谁?

  • 需要处理访谈、播客、课程或直播回放的内容团队
  • 使用Python 3.10+、FFmpeg和本地Ollama的开发者
  • 需要Docker Web、CLI批处理或MCP自动化的工程师