豆包工作AI MediaKit视频剪辑工具:20个命令覆盖剪辑全流程,云端异步处理大文件

AI MediaKit视频剪辑工具

先说结果
byted-mediakit-editing 是豆包工作中 AI MediaKit 专业媒体工具集的视频剪辑域,提供 20 个命令行工具,覆盖裁剪、拼接转场、调速、滤镜、运镜、字幕压制、混音、音视频合流、动图截取等剪辑全流程。全部云端异步处理,支持 4K 分辨率、100 轨混音、13 种转场特效,本地文件自动上传,无需手动转码。一条命令完成一个剪辑动作,多条命令串联即可搭建自动化剪辑流水线。

一、技能定位与核心优势

AI MediaKit 是面向音视频与图像处理的专业工具集,统一通过 mediakit-cli 调用,分为四大领域:

领域 负责什么 典型场景
editing(本文) 对现成素材做裁剪、拼接、调速、滤镜、运镜、字幕、混音 视频剪辑、成片合成、批量处理
audio 音频媒资探测、转码、人声背景分离 音频格式转换、去人声
image 图片尺寸体积治理、增强擦除、打码水印、OCR 图片压缩、抠图、去水印
video 视频理解、高光拆条、抽帧、字幕提取、画质增强 视频分析、智能剪辑、超分

editing 域的核心优势

1
命令行驱动,可脚本化:每个剪辑动作就是一条 mediakit-cli editing <tool> 命令,可写入 Shell/Python 脚本,搭建自动化剪辑流水线。
2
云端异步处理大文件:所有工具异步执行,提交后返回 task_id,轮询查询结果。支持 4K 分辨率、单文件 10GB,本地机器无需高性能显卡。
3
四种输入协议:支持公网 HTTP/HTTPS URL、本地文件路径(自动上传)、火山引擎 VOD vod://、对象存储 TOS tos://,灵活对接各种存储。
4
格式兼容广:输入支持 mp4、flv、ts、avi、mov、wmv、mkv 等主流格式,输出统一为 MP4(视频)或 mp3/m4a/wav/flac/ogg(音频)。

二、20 个工具全景图

按功能分为六大类,每个工具对应一条 CLI 命令:

类别 工具名 命令 核心能力
裁剪类 trim-video editing trim-video 按起止时间截取视频片段
trim-audio editing trim-audio 按起止时间截取音频片段
crop-video editing crop-video 按矩形区域裁剪视频画面
拼接类 concat-video editing concat-video 多视频顺序拼接+13种转场,最多100个
concat-audio editing concat-audio 多音频片段顺序拼接
stitch-video editing stitch-video 多画面水平/垂直空间拼接(对比画面)
调速类 adjust-video-speed editing adjust-video-speed 视频倍速播放(快放/慢放)
adjust-audio-speed editing adjust-audio-speed 音频倍速播放
音频处理 adjust-video-volume editing adjust-video-volume 调整视频音量/静音
mix-audio editing mix-audio 多轨混音(BGM+人声+音效),最多100轨
mux-audio-video editing mux-audio-video 音视频合并/替换音轨
extract-audio editing extract-audio 从视频分离音轨
fade-audio editing fade-audio 音频淡入淡出
fade-video-audio editing fade-video-audio 视频音轨片头片尾淡入淡出
画面处理 apply-video-filter editing apply-video-filter 5种滤镜:春日/晚霞/鲜亮/白皙/食物
apply-camera-motion editing apply-camera-motion 4种运镜:zoom/pan-zoom/orbit-360/bounce
flip-video editing flip-video 视频上下/左右镜像翻转
rotate-video editing rotate-video 视频整体旋转
字幕 add-subtitle-to-video editing add-subtitle-to-video 字幕压制,3种字体/4种位置,支持SRT/VTT/ASS
动图 extract-animated-image editing extract-animated-image 截取片段生成GIF/WebP动图,最长60秒

三、六大核心能力详解

1
视频拼接 + 13 种转场(concat-video)
一次最多拼接 100 个视频,支持 13 种转场特效:交替出场、旋转放大、泛开、六角形、故障转换、飞眼、梦幻放大、开门展现、立方转换、透镜变换、晚霞转场、圆形交替等。转场 ID 用逗号分隔传入,视频数量超过转场数量时自动循环使用。输入分辨率不一致时,以第一个视频为基准输出。
2
字幕压制(add-subtitle-to-video)
支持两种输入方式:直接传字幕文件 URL(SRT/VTT/ASS),或用 JSON 数组逐条传入字幕内容(含 start_time/end_time/subtitle_text)。3 种字体:思源黑体(正文首选)、庞门正道标题体(大标题/封面)、站酷快乐体(轻松搞笑 Vlog)。4 种位置:底部居中(横屏默认)、顶部居中、画面正中、偏下三分之一(竖屏默认)。支持自定义字号和 RGBA 颜色。
3
多轨混音(mix-audio)
将背景音乐、人声、音效等最多 100 个音频文件混合为一个音频,输出时长以最长音频为准。支持 mp3/m4a/ogg/flac/wav 五种输出格式,默认 m4a。平均处理耗时与原片时长比为 1:1(RTF=1)。适合短视频 BGM+人声+环境音的一键合成。
4
视频滤镜(apply-video-filter)
5 种预设滤镜:春日(spring,清新明亮)、晚霞(sunset,暖橙色调)、鲜亮(vivid,高饱和)、白皙(fair_skin,人像美化)、食物(food,美食增强)。支持最高 4K 分辨率,单文件最大 10GB。一条命令完成全片调色,无需逐帧调整。
5
运镜特效(apply-camera-motion)
对静态或低动态视频添加专业运镜,4 种风格:zoom(缓慢推拉)、pan-zoom(平移+缩放)、orbit-360(360 度环绕)、bounce(弹跳运镜)。可指定起止时间段,默认从片头到片尾。适合素材二次创作、营销片头、短剧动效。注意:视频时长不得超过 5 分钟,最高 1080p。
6
动图截取(extract-animated-image)
从视频中按起止时间截取一段,生成 GIF 或 WebP 动图,最长 60 秒,固定 15fps,最大分辨率 480p。适合制作封面动图、营销素材、短视频预览。WebP 格式体积更小、画质更好,推荐优先使用。

四、标准工作流七步走

1
可用性检查:运行 mediakit-cli --version 确认 CLI 已安装,mediakit-cli --domains 查看可用领域。
2
选定工具:根据处理目标从 20 个工具中选择,运行 mediakit-cli editing --help 查看工具列表。
3
读取参考文档:选定工具后,先读取该工具的完整 reference(参数说明、枚举值、使用指南),再运行 mediakit-cli editing <tool> --schema 读取实时机器合同。
4
构造参数:必填参数必须来自用户真实输入;可选参数只在用户明确提供或可从意图准确确定时填写,不得伪造 URL、文件、枚举或业务参数。
5
提交任务:运行命令提交异步任务,成功后返回 task_id。本地文件路径会自动上传,无需手动处理。
6
查询结果:运行 mediakit-cli shared query-task --task-id <task_id> --poll-complete 轮询直到完成,结果包含输出文件 URL(临时链接 24 小时有效,需及时下载)。
7
串联流水线:将上一步的输出 URL 作为下一步的输入,多条命令串联即可完成复杂剪辑(如:裁剪→加滤镜→加字幕→拼接→混音)。

五、三套豆包工作输入指令(照抄即用)

在豆包工作中,你不需要手动输入 CLI 命令。只需用自然语言描述需求,AI 会自动读取技能文档、构造参数、调用 mediakit-cli 并轮询结果。以下三套指令可直接复制到豆包工作对话框中使用:

指令 1 短视频成片流水线(裁剪+滤镜+字幕+拼接)
帮我用 AI MediaKit 视频剪辑工具处理这条短视频,按以下步骤操作:

1. 从第10秒裁剪到第40秒,保留精彩片段
2. 给裁剪后的视频加"晚霞"滤镜
3. 压制字幕,字幕内容:"大家好,今天给大家分享一个超实用的剪辑技巧",显示时间0-3秒,位置偏下三分之一,用站酷快乐体
4. 把处理好的片段和另外两个片段 clip2.mp4、clip3.mp4 按顺序拼接,拼接处加"泛开"和"晚霞转场"效果

素材文件:input.mp4、clip2.mp4、clip3.mp4(已上传)
每步完成后告诉我结果,最后输出成片下载链接。
指令 2 音频处理流水线(提取+混音+淡入淡出+合并)
帮我用 AI MediaKit 视频剪辑工具做音频处理,按以下步骤操作:

1. 从 input.mp4 视频中提取音轨
2. 把提取的人声、bgm.mp3 背景音乐、sfx.mp3 音效三个音频混合在一起,输出 mp3 格式
3. 给混音后的音频加首尾淡入淡出效果
4. 把处理好的音频替换回原视频 input.mp4 的音轨,输出最终视频

素材文件:input.mp4、bgm.mp3、sfx.mp3(已上传)
每步完成后告诉我结果,最后输出成片下载链接。
指令 3 营销素材流水线(运镜+调速+动图截取+多画面拼接)
帮我用 AI MediaKit 视频剪辑工具制作营销素材,按以下步骤操作:

1. 给 input.mp4 视频前5秒加"zoom"运镜效果,让静态画面动起来
2. 把运镜后的视频调到1.5倍速
3. 从第2秒到第5秒截取3秒片段,生成 WebP 格式动图,用作封面动图
4. 把 before.mp4 和 after.mp4 两个视频左右水平拼接,做对比画面

素材文件:input.mp4、before.mp4、after.mp4(已上传)
每步完成后告诉我结果,最后分别输出动图和对比视频的下载链接。

六、适用场景与边界

适合场景
批量短视频剪辑:多条命令脚本化,批量处理几十上百条短视频素材,自动裁剪+加字幕+拼接+混音。
AI 短剧/漫剧后期:AI 生成的视频片段用 concat-video 拼接+转场,add-subtitle-to-video 压制字幕,mix-audio 合成 BGM+配音。
营销素材自动化:extract-animated-image 批量生成封面动图,apply-video-filter 统一调色,stitch-video 做对比画面。
音频播客制作:extract-audio 提取音轨,mix-audio 混音,fade-audio 淡入淡出,concat-audio 拼接多期节目。
无本地高性能设备:全部云端处理,本地只需能运行 CLI,4K 视频也能轻松处理。
不适合场景(转其他技能)
从零视频创作/广告创意:需要脚本、分镜、提示词规划 → 转 doubao-creative-video
短剧/剧情/分镜生产:需要完整短剧创作流程 → 转 doubao-creative-drama
视频理解/高光拆条/字幕提取:需要 AI 分析视频内容 → 转 byted-mediakit-video
人声背景分离/音频转码:需要音频智能处理 → 转 byted-mediakit-audio
图片增强/抠图/去水印:需要图像处理 → 转 byted-mediakit-image

七、避坑提醒

避坑提醒
1
异步任务必须轮询:所有工具都是异步执行,提交后只返回 task_id,必须用 query-task --poll-complete 等待完成,不要以为命令执行完就有结果。
2
临时链接 24 小时过期:未设置 media_output_destination 时,输出 URL 是临时下载链接,有效期 24 小时,务必及时下载保存。需要持久化存储时设置 vod://tos://
3
JSON 参数传参规范:对象/对象数组参数(如 --subtitles)必须传合法 JSON 字符串。bash 用单引号整体包裹;Windows PowerShell 必须把 JSON flag 放在 --% 之后,内部双引号写成 \",禁止单引号 JSON 和 $json 变量。
4
数组参数用逗号分隔--video-urls--audio-urls--transitions 等数组参数传多个值时用逗号分隔并整体加引号,单个 URL 不能包含逗号,否则会被拆成多个元素。
5
运镜工具有时长限制:apply-camera-motion 视频时长不得超过 5 分钟,最高 1080p。超长视频需要先裁剪再添加运镜。
6
字幕位置要避开平台控件:成片用于短视频/漫剧平台时,字幕位置要避开平台操作栏、进度条和互动控件。竖屏推荐 lower_third,横屏推荐 bottom_center

八、一句话收个尾

AI MediaKit 视频剪辑工具的核心价值不是"替代剪映",而是把剪辑动作命令化、脚本化、云端化。20 个工具覆盖从裁剪到混音的全流程,一条命令一个动作,多条命令串联就是一条自动化剪辑流水线。当你需要批量处理几十条短视频、用脚本控制剪辑逻辑、或者本地设备跑不动 4K 视频时,这套 CLI 工具集就是最高效的选择。

作者声明:本作品含 AI 生成内容