
先说结果
byted-mediakit-audio 是豆包工作中 AI MediaKit 专业媒体工具集的音频处理域,提供 4 个专业工具:人声背景声分离(separate-voice,输出人声+伴奏两个独立文件)、语音端点识别(detect-voice-activity,自动定位有效人声起止时间戳)、音频转码(transcode-audio,MP3/M4A/OGG三格式,码率/采样率/声道/音量均衡全参数控制)、音频元信息探测(probe-audio-metadata,容器层+音频流双层元信息)。全部云端异步处理,支持音频和视频两种输入,一条自然语言指令即可触发复杂音频处理流水线。
一、技能定位与核心优势
AI MediaKit 音频处理域(audio)与视频剪辑域(editing)的核心区别:editing 做音频的剪辑合成操作(裁剪、拼接、调速、淡入淡出、混音、音视频合流),audio 做音频的智能理解与格式治理(人声分离、端点识别、专业转码、元信息探测)。两者互补,常串联使用。
audio 域的核心优势:
1
AI 人声背景声精准分离:separate-voice 基于 AI 算法将人声与背景音精准分离,输出两个独立音频文件。不是简单的声道消除,而是 AI 模型识别分离,即使人声和伴奏在同一声道也能精准分离。适合提取伴奏、提纯人声、去 BGM 等场景。
2
语音端点自动识别:detect-voice-activity 自动定位音频/视频中所有有效人声的起止时间戳,区分人声和静音/背景噪声。返回结构化的人声片段列表,可直接用于自动剪辑静音片段、播客章节定位、会议录音有效片段提取、ASR 预处理等。
3
专业级音频转码:transcode-audio 支持 MP3/M4A/OGG 三种封装格式(对应 MP3/AAC/Opus 编码器),可精确控制码率(10-500Kbps,CBR/CAE 两种模式)、采样率(8000-96000Hz 共 12 档)、声道(单声道/双声道),还支持 2Pass 音量均衡(LUFS 响度标准化,防止削波失真)和元信息标签管理(保留/新增标题艺术家等标签)。
4
音频+视频双输入,全格式兼容:separate-voice 和 detect-voice-activity 支持直接输入视频文件(自动提取音轨处理),无需先用 editing 域提取音频。输入支持 mp3/m4a/wav/wma/amr/aac/ogg/flac 等主流音频格式,以及 mp4/flv/ts/avi/mov/wmv/mkv 等视频格式。
二、4 个工具全景图
| 工具名 |
命令 |
核心能力 |
输入 |
输出 |
| separate-voice |
audio separate-voice |
人声背景声分离,AI 精准分离人声和伴奏 |
音频或视频 |
人声文件+背景音文件(aac/mp3/wav/m4a/flac) |
| detect-voice-activity |
audio detect-voice-activity |
语音端点识别,自动定位有效人声起止时间戳 |
音频或视频 |
人声片段数量+起止时间戳列表(结构化数据) |
| transcode-audio |
audio transcode-audio |
专业音频转码,格式/码率/采样率/声道/音量均衡全控制 |
音频 |
转码后音频文件(MP3/M4A/OGG) |
| probe-audio-metadata |
audio probe-audio-metadata |
音频元信息探测,容器层+音频流双层元信息 |
音频 |
元信息 JSON(格式/码率/采样率/声道/时长/大小/MD5) |
三、四大核心能力详解
1
人声背景声分离(separate-voice)
基于 AI 算法将音频或视频中的人声与背景音精准分离,输出两个独立音频文件:voice_audio_url(纯人声)和 background_audio_url(纯伴奏/背景音)。支持直接输入视频文件(自动提取音轨),也支持纯音频输入。输出格式可选 aac/mp3/wav/m4a/flac,默认 mp3。
典型应用场景:
• 提取伴奏:从歌曲中分离出纯伴奏,用于卡拉OK、翻唱、Remix
• 提纯人声:从嘈杂环境录音中提取清晰人声,用于播客、语音识别、AI 训练数据
• 视频去 BGM:从视频中分离人声和背景音乐,单独替换 BGM 或调整音量比例
• 配音提取:从影视片段中提取纯人声台词,用于配音练习、台词整理
2
语音端点识别(detect-voice-activity)
自动定位音频或视频文件中所有有效语音的起止时间,将人声和静音、背景噪声等无效片段区分开来。返回 segment_count(人声片段数量)和 voice_segments(每个人声片段的 start_time 和 end_time,精确到小数点后两位秒)。支持音频和视频两种输入,audio_url 和 video_url 二选一。
典型应用场景:
• 自动剪辑静音片段:根据端点识别结果,用 editing 域的 trim-video 自动剪掉所有静音/无效片段,生成紧凑版播客或课程视频
• 播客/会议章节定位:识别人声段落,用于自动生成章节标记、定位发言时段
• ASR 预处理:只对有效人声片段做语音识别,跳过静音段,提升识别效率和准确率
• 有效内容占比分析:统计一段录音中有效人声占总时长的比例,评估内容密度
3
专业音频转码(transcode-audio)
将一个音频码流转换为另一个,涉及编码格式、编码参数和封装格式的转换。三种封装格式:MP3(MP3 编码器,通用兼容)、M4A(AAC 编码器,高质量低码率,支持 CAE 动态码率)、OGG(Opus 编码器,超低码率高质量,适合流式传输)。
可精确控制的参数:
• 码率:10-500 Kbps,默认 128,支持 CBR(恒定码率,文件大小可预测,适合流式传输)和 CAE(动态码率,根据内容复杂度调整,仅 M4A 支持)
• 采样率:8000-96000Hz 共 12 档,默认 48000,MP3 最高 48000,AAC 最高 96000,Opus 固定 48000
• 声道:单声道(1)或双声道(2),默认双声道
• 音量均衡:可选 2Pass 两阶段响度分析与处理,目标综合响度 -70 至 -5 LUFS(默认 -12),响度范围 1-20 LU(默认 7),真实峰值上限 -9 至 0 dBTP(默认 0),防止削波失真
• 元信息标签:支持从源文件保留指定标签(metadata_keep-tags),也可新增标签(metadata_add-tags,如标题/艺术家/专辑),转码默认丢弃大部分元信息
4
音频元信息探测(probe-audio-metadata)
探测输入音频 URL,输出标准化的双层元信息:容器层(format_meta:封装格式、容器码率、时长、文件大小、MD5)和 音频流层(audio_stream_meta:编码格式、流码率、采样率、声道数、时长)。无音频流时返回 null。
典型应用场景:
• 流水线前置检查:在转码/分离/端点识别前,先探测音频的编码/采样率/码率/时长,判断是否需要预处理或选择合适的转码参数
• 音频质量评估:通过码率/采样率/声道数判断音频质量等级
• 批量文件格式统计:批量探测音频库,统计格式分布、码率分布、总时长等
• 文件完整性校验:通过 MD5 和时长信息校验文件是否完整
四、标准工作流
1
明确业务目标:先确定要做什么——分离人声?识别端点?转码?探测元信息?不同目标对应不同工具。只说"处理音频"而未说明目标时,AI 会先澄清。
2
前置探测(推荐):复杂处理前先用 probe-audio-metadata 探测音频元信息(编码/采样率/码率/时长),根据探测结果选择合适的转码参数或判断是否需要预处理。
3
选定工具链:从 4 个工具中选择一个或多个串联。简单任务单工具即可(如"给这首歌提取伴奏"),复杂任务需要多工具流水线(如播客处理:探测→分离人声→端点识别→转码标准化)。
4
豆包工作输入指令:用自然语言描述需求,包含素材文件、具体参数(如输出格式、码率、采样率、音量均衡等),AI 会自动读取技能文档、构造参数、调用 CLI。
5
异步任务轮询:audio 域所有工具都是异步执行,提交后返回 task_id,AI 自动用 query-task --poll-complete 轮询直到完成。结果包含处理后的音频文件 URL(临时链接 24 小时有效)或结构化数据(端点识别/元信息探测)。
6
串联 editing 域完成剪辑:audio 域的输出(人声文件、端点时间戳、转码后音频)常作为 editing 域的输入,用 trim-audio/concat-audio/mix-audio/mux-audio-video 等完成最终剪辑合成。
五、三套豆包工作输入指令(照抄即用)
在豆包工作中,你不需要手动输入 CLI 命令。只需用自然语言描述需求,AI 会自动读取技能文档、构造参数、调用 mediakit-cli。以下三套指令可直接复制到豆包工作对话框中使用:
帮我用 AI MediaKit 音频处理工具处理这期播客录音,按以下步骤操作:
1. 先用元信息探测(probe-audio-metadata)查看音频的编码格式、采样率、码率、声道数和时长,告诉我探测结果
2. 用人声背景声分离(separate-voice)把人声和背景音分开,输出格式用 wav,分别给我纯人声和纯背景音的下载链接
3. 用语音端点识别(detect-voice-activity)对原始录音做人声端点检测,返回所有有效人声片段的起止时间戳列表和片段总数,帮我统计一下有效人声占总时长的比例
4. 最后用音频转码(transcode-audio)把分离出的纯人声转成标准化播客格式:M4A 封装(AAC 编码),码率 96Kbps,采样率 44100Hz,双声道,开启 2Pass 音量均衡(目标响度 -16 LUFS,真实峰值 -1 dBTP),保留原文件的标题和艺术家元信息标签
素材文件:podcast_episode.mp3(已上传,约 45 分钟)
每步完成后告诉我结果,最后输出元信息报告、人声/背景音下载链接、端点识别时间戳列表和标准化播客音频下载链接。
帮我用 AI MediaKit 工具给这条视频替换背景音乐,按以下步骤操作:
1. 先用音频处理域的人声背景声分离(separate-voice)直接处理视频文件,把人声和原背景音乐分开,输出格式用 mp3,给我纯人声音频和原背景音乐的下载链接
2. 用音频转码(transcode-audio)把纯人声音频转成高质量格式:M4A 封装,码率 192Kbps,采样率 48000Hz,双声道,开启 2Pass 音量均衡(目标响度 -14 LUFS,真实峰值 -1 dBTP)
3. 切换到视频剪辑域(editing),用音视频合并(mux-audio-video)把转码后的纯人声音频和新背景音乐 new_bgm.mp3 先混音(mix-audio,人声和BGM音量比 3:1),再把混音结果替换回原视频的音轨,输出最终视频
素材文件:original_video.mp4(已上传)、new_bgm.mp3(已上传)
每步完成后告诉我结果,最后输出纯人声下载链接、转码后人声下载链接和替换背景音乐后的最终视频下载链接。
帮我用 AI MediaKit 工具自动剪辑这段会议录音,去掉所有静音和无效片段,按以下步骤操作:
1. 先用音频处理域的语音端点识别(detect-voice-activity)检测会议录音中所有有效人声片段,返回每个人声片段的起止时间戳和片段总数
2. 切换到视频剪辑域(editing),根据端点识别结果,用音频裁剪(trim-audio)把每个人声片段单独裁剪出来,再用音频拼接(concat-audio)把所有有效人声片段按时间顺序拼接成一段紧凑的会议录音(去掉所有静音间隔)
3. 用音频处理域的音频转码(transcode-audio)把拼接后的紧凑会议录音转成适合存档的格式:MP3 封装,码率 64Kbps(单声道语音足够),采样率 22050Hz,单声道,开启 2Pass 音量均衡(目标响度 -18 LUFS),新增元信息标签:标题"2026Q3产品评审会-紧凑版",艺术家"AI智能编辑DB"
素材文件:meeting_recording.m4a(已上传,约 90 分钟,有大量静音和讨论间隙)
每步完成后告诉我结果,最后输出端点识别时间戳列表、裁剪了多少个片段、节省了多少时长,以及最终紧凑版会议录音的下载链接。
六、适用场景与边界
适合场景
✅
播客/音频内容制作:人声提纯、端点识别自动剪静音、音量均衡标准化、格式转换,一条流水线搞定播客后期。
✅
视频去 BGM / 替换音乐:separate-voice 直接处理视频分离人声和伴奏,再用 editing 域混音合流,轻松替换视频背景音乐。
✅
会议/课程录音自动剪辑:端点识别定位有效人声,自动剪掉静音片段,生成紧凑版录音,节省存储空间和回放时间。
✅
卡拉OK 伴奏提取 / 翻唱:从歌曲中 AI 分离纯伴奏,用于卡拉OK、翻唱、Remix 创作。
✅
音频格式标准化 / 批量转码:专业转码支持 MP3/M4A/OGG 三格式,精确控制码率/采样率/声道/音量均衡,适合音频库格式统一、流媒体适配、存档压缩。
不适合场景(转其他技能)
❌
音频裁剪/拼接/调速/淡入淡出/混音/音视频合流:需要音频剪辑合成操作 → 转 byted-mediakit-editing
❌
语音转字幕/ASR 文字识别:需要从语音中识别文字内容 → 转 byted-mediakit-video 的 asr-subtitles(支持音频输入)
❌
从零生成音频/语音合成/音效创作:需要 AI 生成音频内容 → 转 seed-audio
❌
视频画面裁剪/字幕压制/视频滤镜:需要视频剪辑操作 → 转 byted-mediakit-editing
七、避坑提醒
避坑提醒
1
audio 域全部异步,需轮询:与 image 域大部分同步不同,audio 域 4 个工具全部异步执行,提交后返回 task_id,必须用 query-task --poll-complete 轮询直到完成。不要以为命令执行完就有结果。
2
separate-voice 的 audio_url 只支持公网 URL:separate-voice 的 audio_url 参数仅支持公网可访问的 HTTP/HTTPS URL,不支持本地文件路径和 vod:///tos://。但 video_url 参数支持四种输入协议(含本地文件)。如果只有本地音频文件,可以先用 video_url 不行——建议先上传到公网或用其他方式获取公网 URL。
3
detect-voice-activity 的 audio_url 和 video_url 二选一:必须且只能提供其中一个,不能同时传。两者都支持公网 HTTP/HTTPS 直链或 mediakit/tos/vod 平台资源链接。
4
transcode-audio 的 JSON 参数传参规范:--audio 参数是 object 类型,必须传合法 JSON 字符串(如 '{"bitrate_kbps":128,"sample_rate":44100}')。bash 用单引号整体包裹;Windows PowerShell 必须把 JSON flag 放在 --% 之后,内部双引号写成 \"。--metadata-keep-tags 是数组字符串,用逗号分隔。
5
转码默认丢弃元信息标签:transcode-audio 默认会丢弃大部分元信息(如标题、艺术家)。如果需要保留原文件的标签,必须显式传入 --metadata-keep-tags 指定要保留的标签键。需要新增标签时用 --metadata-add-tags。
6
临时链接 24 小时过期:所有输出音频 URL 都是临时下载链接,有效期 24 小时,务必及时下载保存。端点识别结果和元信息探测结果是结构化 JSON 数据,也要及时保存。
八、一句话收个尾
AI MediaKit 音频处理的核心价值是把"听懂音频"和"治理音频"的能力工具化、流水线化。4 个工具虽然数量不多,但覆盖了从人声分离到端点识别、从专业转码到元信息探测的音频处理核心链路,且能与 editing 域的剪辑合成工具无缝串联。当你需要给播客自动剪静音、给视频替换背景音乐、给会议录音做紧凑版、或者批量标准化音频格式时,这套工具集就是最高效的选择——在豆包工作中用一句自然语言指令,就能触发复杂的音频处理流水线。
作者声明:本作品含 AI 生成内容