K歌 · 音频娱乐AI大模型

万利:让K歌背后的AI,先听懂声音,再谈修音与评分

万利是上海万利娱乐ai软件公司围绕K歌与音频娱乐打造的音频AI大模型平台。我们把歌声分析、AI修音、智能评分、AI合唱、伴奏生成、人声分离、音色转换、AI声乐训练与播客生成,当作同一套音频工作流里互相关联的问题来做,而不是八个互不相干的独立小工具。

8项核心音频AI能力
Pitch / F0逐帧分析
Reference-free可选评价路径
万利音频AI大模型演示界面,展示人声波形音高曲线和修音评分合唱伴奏分离转换训练播客等功能节点
Audio AI Workflow

K歌音频AI完整工作流

从一段录音到最终可用的修音、评分、合唱或伴奏结果,中间不是八个孤立模型的拼接,而是一条共享音频特征表示的工作流。

万利K歌音频AI完整工作流示意图,展示从录音输入经过预处理分析到修音评分合唱伴奏分离转换训练播客等任务分发的整体结构
录音先经过输入质量检测和特征分析,再按具体任务路由到对应模型,最后统一解码为可听音频。

这也是为什么万利把"音频大模型"和"K歌工具"放在一起讲——如果每个功能都各自处理一遍音频,不仅浪费算力,还容易出现"分离时用的人声"和"修音时用的人声"版本不一致的问题。这条工作流的细节,我们在万利平台里有更完整的说明。

AI已经能够把每一个音都修到标准音高以后,为什么真正自然的修音反而必须保留一部分"不准确"?

这里先别急着看修音前后的音准对比数字。耳机里先A/B一次原声和处理声——如果处理后的那一遍让你觉得"准是准了,但不太像这个人在唱",问题往往不在算法出错,而在于它把不该修的东西也修掉了。

歌声不是一串对准音高的直线

真人演唱时,一个音符从起音(Attack)到结束,音高几乎不可能保持绝对水平。它会有轻微的Pitch Drift(音高漂移)、句尾或转折处的Portamento(滑音)、长音上的Vibrato(颤音),还有换气前后的Micro-timing(微小时值变化)。这些偏差不是"没唱准",而是人类发声器官本身的运作方式,也是听众用来判断"这是不是一个活生生的人在唱歌"的重要线索。

AI修音的第一步是F0 Detection——逐帧提取基频轨迹,再做Note Alignment,把这条轨迹对应到乐谱或参考旋律上的音符网格。如果算法在这一步之后,直接把所有帧的F0拉到最近音符的中心线,技术上"音准"确实会变得非常漂亮:Pitch Error趋近于零。但代价是,颤音的规律性起伏、滑音的过渡曲线、句尾自然下坠的表现全部消失,声音会变成教科书式的、缺乏呼吸感的"完美"音高——很多人第一反应会说这听起来"像机器人"。

歌声音高曲线示意图,显示F0随时间变化包含颤音滑音和音符网格线的真实演唱轨迹
真实演唱的F0轨迹(实线)与量化音高目标(虚线)之间,本来就存在大量有意义的偏差。

三个必须分开处理的层级

万利在设计AI修音时,把问题拆成三个层级,而不是一个"修/不修"的开关:

  • 第一层:Pitch Error Correction。只处理明显偏离音符中心、超出正常演唱范围的跑调,这部分误差通常听感上也确实刺耳,是大多数用户真正想修的内容。
  • 第二层:Performance Preservation。先识别出Vibrato和Portamento所在的区间,在修正音高误差时主动绕开或减弱对这些区间的处理,保留自然的时值变化。
  • 第三层:Style-aware Correction。根据歌曲风格(比如R&B更依赖滑音修饰、民谣更看重气声的自然摆动)、用户当前的演唱水平和目标效果,决定修正的整体强度和分区间的权重分配。
AI修音从歌声F0检测音符对齐颤音识别滑音保护到自然音高修正形成完整处理流程图,并对比强制拉直音高导致表现力丢失的路径
Natural Pitch Correction Pipeline:颤音识别与滑音识别在音高误差计算之后、修正强度决定之前介入,避免被当成误差抹平。

为什么"自动修音"和传统人工修音是两回事

在AI修音出现之前,人工修音依赖录音师逐句手动调整音高曲线,效率低但可以精细拿捏每一句的修正尺度。Auto Pitch Correction把这个过程自动化,但也带来一个新问题:算法需要在没有人工判断的情况下,自己决定"这里到底要不要修"。这也是为什么万利的AI修音会先做Note Alignment再计算Pitch Error,而不是简单套用一条固定的量化网格——如果对齐环节出错,后面所有的修正强度调节都会建立在错误的基础上。

Correction Strength 不是"修得对不对",是权衡

很多人期待的AI修音是一个"开/关"按钮:开了就准,关了就是原声。但实际上,修音强度更接近一个连续的权衡参数——强度越高,Pitch Error越接近零,但Vibrato Depth和Portamento的过渡时长也会同步被压缩;强度越低,个人演唱习惯保留得越完整,但明显的跑调也会残留。万利的处理方式是把这个参数暴露给用户(可以在万利K歌里体验分维度调节),而不是替用户悄悄决定"多少算合适"。

共振峰同样需要保护。 如果只移动音高而不同步调整Formant(共振峰)位置,声音会出现类似"变声器"的不自然音色变化,尤其在升调较多时更明显——这也是为什么万利修音流程里,Formant Preservation是Correction Strength之后单独的一步,而不是顺带处理。

实时修音和离线修音不是同一个技术问题

K歌应用里常见两种场景:一种是录音完成后再统一处理(离线修音),另一种是演唱过程中实时监听修正后的效果(实时修音)。离线处理可以看到完整的上下文,音符对齐和颤音识别的判断会更准;实时监听则必须在极短的延迟内给出结果,能用于分析的上下文更少,处理精细度通常会打折扣。把离线处理的效果直接当作实时监听的体验来宣传,是一种常见的误导——两者对延迟和可用上下文的要求完全不同。

实际使用中,"轻度修音"和"强修音"的差别不只是数值大小,而是修正会不会开始触及Vibrato和Portamento所在的区间——轻度修音通常只处理明显超出音符范围的误差,强修音则会逐步把接近边界的自然偏差也拉回中心线。万利的AI修音也支持只对某几句、甚至某几个音单独调整强度,而不必对整首歌使用同一个参数,这对副歌高音区和主歌气声区往往需要不同处理方式的情况尤其有用。

举一个具体场景:一句副歌结尾的长音,真实演唱里往往会有自然的音量和音高双重收尾——音量逐渐变弱,音高也可能随着气息不足轻轻下滑。如果修音算法只盯着音高误差,把这个自然收尾的下滑也当成"没唱准"去拉直,结果就是这句歌的结尾从"意犹未尽"变成"戛然而止",听感上的损失往往比留着这个小小的音高偏差更明显。这也是万利在设计修音强度曲线时,会特意在乐句结尾处降低修正力度的原因之一。不同曲风对这种收尾处理的容忍度也不一样:流行抒情曲通常需要保留更多这类自然收尾,节奏感强的舞曲则对精确的音高收束要求更高,风格判断因此也会影响修正强度的分配方式。

自然的修音,目标不是"消灭所有偏差",而是"只消灭听感上真正算错误的那部分偏差"。

K歌AI已经可以逐帧比较音准和节奏以后,为什么"唱歌92分"仍然不能告诉用户自己到底唱得好不好?

这里先别看那个92。先问一句:这92分里,音准占了多少、节奏占了多少、气息和音色又占了多少?如果答不出来,这个分数其实只是一个被压缩到无法还原的总和。

歌唱表现远不止Pitch和Rhythm

传统K歌评分擅长做的事情,是把Pitch Accuracy和Rhythm Accuracy量化成分数——这两项确实容易逐帧计算,也容易理解。但真实的歌唱表现,还包含Breath Control(气息控制是否稳定、乐句是否被气息不足打断)、Timbre(音色的明暗、气声程度)、Dynamics(强弱对比是否有层次)、Pronunciation(咬字是否清晰)、Vibrato(颤音的自然程度)、Emotional Expression(情感表达)、Vocal Technique(发声技巧)以及Consistency(同一段落多次演唱的稳定性)。只用Pitch和Rhythm去代表全部歌唱能力,相当于只用身高体重去评价一个人的运动能力。

K歌智能评分同时分析音准节奏气息音色动态表达和稳定性形成多维歌唱能力雷达图
Singing Skill Profile:多个维度共同构成一次演唱的完整画像,而不是压缩成一个数字。

Reference-based 与 Reference-free,两种不同的评价思路

Reference-based评分把用户演唱和目标旋律或参考音频逐帧比较,优势是容易评价Pitch和Timing是否贴合;限制是可能过度奖励"唱得像参考"本身,而不是奖励演唱质量——一段带有个人风格改编、故意偏离原唱的处理,可能因为"不像参考"而被扣分。Reference-free评分不依赖某一条标准演唱,转而直接分析音准稳定性、气息支撑、音色特征、表现力和技巧本身;它更适合评价个人风格和表现力,但对"是否唱对了旋律"这类问题的判断力较弱。这两种思路不是互相取代的关系,K歌场景常见做法是以Reference-based为主,用Reference-free的信号做补充。

Reference based与Reference free两种歌唱评价思路对比图,分别展示依赖标准旋律比较和不依赖参考直接分析演唱特征的路径
两种评价路径覆盖的问题不完全重合,结合使用比单独依赖一种更完整。

音高检测也有置信度,不是每一帧都同样可信

低信噪比、气声演唱、假声、多人声重叠,都会让F0检测的置信度下降。一套负责任的评分系统,应该允许某些帧标记为低置信度,而不是假装每一帧都被同样精确地检测到——如果强行给出一个看似精确的数字,反而会在低质量输入下产生虚假的确定性。

节奏也不该只看有没有踩在节拍点上

歌手有时会故意提前或拖后进入某个音符,制造Rubato(自由节奏)式的表现张力,这是一种常见的演唱处理手法,而不是节奏不稳。如果Rhythm Assessment只简单地比较演唱时刻和节拍网格的距离,会把这种有意的处理当成节奏错误来扣分,评分算法需要结合歌曲风格判断这种偏离是不是"故意的"。

音色不是一个简单的好听指数

音色可以用Bright、Dark、Breathy、Warm、Rough、Soft这类属性词描述,但这些描述本身通常不是"好"或"坏"的判断,而是风格特征。评分系统应该区分Attribute(音色属于哪种类型)和Quality(这种音色的稳定性、清晰度是否达标),而不是把某一种音色风格直接判定为更高分。

评分还会受录音条件影响

同一个人唱同一句歌,麦克风质量、房间噪声、混响、伴奏泄漏(Backing Track Leakage)、设备延迟、音频压缩,都会让评分结果出现波动。这不是评分算法"不准",而是输入信号本身的质量在变化。万利在万利平台里专门讨论了Input Quality Check的必要性——如果录音质量明显不达标,更负责任的做法是提示用户重新录制,而不是硬给出一个看似精确、实际上不可信的分数。

Cent不是唯一标准。 音准误差常用Cent衡量,100 Cents约等于一个半音,但"偏差5 Cents"是否真的会被听出来,取决于具体的演唱环境、音色和听者状态——不能简单地把某个数值门槛当成"用户一定能听见"的绝对标准。同样,低信噪比、气声演唱、假声、多人声重叠等情况下,音高检测本身也会有置信度下降的时候,好的评分系统会把这种不确定性反映出来,而不是假装每一帧都绝对准确。

这也是为什么万利把Reference-based和Reference-free两类信号放在一起使用——前者能判断"有没有唱对旋律",后者能判断"这段音色和气息是否稳定、是否具备技巧性",单独依赖任何一种,都会漏掉另一半信息。

再看一个具体例子:两位用户都在某一句副歌里得到了同样的音准分数,但其中一位是稳定地略微偏低,另一位则是忽高忽低反复波动。前者更像是音准感知上存在一个固定偏移,练习方向是校准整体音高感;后者更像是气息或状态不稳定导致的随机误差,练习方向完全不同。如果评分系统只输出一个音准分数,这两种情况会被完全抹平成同一个结果,用户拿到反馈后也无从判断自己到底属于哪一种。这也是为什么描述性反馈需要包含误差的分布特征,而不只是误差的平均大小。

时间因素也会影响评分结果:同一个人在早晨和深夜、刚运动完和状态放松时录制的演唱,气息支撑和音准稳定性可能会有明显差异。如果评分系统不考虑录制时间和用户状态的上下文,把不同状态下的分数直接放在一起比较,容易得出"退步了"这样不准确的结论。更合理的做法是关注一段时间内的整体趋势,而不是纠结于单次分数的小幅波动。

一个分数只能排序,一份维度画像才能告诉用户下一步该做什么。

AI已经可以把一条人声复制成十几条声部以后,为什么真正的AI合唱不能只是"同一个人唱了十遍"?

AI合唱最假的时候,往往不是声部音准不准,而是所有人连换气位置都完全一样。耳朵对"整齐"很敏感,但对"整齐到不真实"更敏感。

和声不是简单的整体移调

把主旋律复制几条、整体升三度或升五度,确实能得到"和声"的听感雏形,但这不是真正的Harmony。在不同和弦下,同一条旋律对应的和声音程其实是变化的——同一个音在C和弦下可能构成三度关系,切到Am或F和弦时,为了避免出现刺耳的不协和音,和声声部往往需要落在不同的音级上。这意味着AI合唱系统需要先做Chord Analysis,识别出伴奏或歌曲的和弦走向,再进行Harmony Planning,逐小节规划每个声部应该落在哪个音上,而不是对整条旋律做一次性移调。

和声声部与和弦音程规划示意图,展示同一旋律在不同和弦下方声部音程随之变化而非固定移调
和声声部与主旋律的音程距离随和弦变化,不是固定的移调关系。

声部设计需要分工,不只是数量

一次完整的AI合唱编排,通常需要区分Lead Vocal(主唱)、Upper Harmony(高声部和声)、Lower Harmony(低声部和声)、Double(同度加厚)、Choir Layer(合唱铺底层)和Ad-lib(即兴装饰句)等不同角色,每种角色在音量、位置和处理方式上都不一样——不是简单地把声部数量堆多。

Humanization:统一与差异之间的平衡

真实的多人合唱,不可能所有人完全对齐同一个Timing——不同的人起音时间、呼吸节奏、音高摆动幅度都会有细微差别。AI合唱如果要听起来像"真的有几个人在唱",需要主动引入Micro-timing(微小时序差异)、Pitch Dispersion(音高的细微离散)、Breath Timing(换气位置的错开)、Timbre Variation(音色的细微差异)和Dynamic Variation(力度的细微差异)。但这里有一个真实的平衡问题:变化太少,听起来像同一个人唱了很多遍;变化太多,又会失去合唱应有的整齐感,甚至让人觉得"各唱各的"。核心难点从来不是"要不要加入差异",而是"差异应该控制在多大范围内"。

合唱人声化微小时序与音高差异示意图,展示多个声部在起音时间音高偏移和换气位置上保留细微差异以避免机械整齐感
每个声部的起音时间和换气位置存在细微差异,是多人合唱区别于同一人多轨叠加的关键线索之一。

声部数量不是越多越好

很多人以为AI合唱就是"复制的声部越多越厚",但声部数量增加到一定程度后,边际收益会迅速下降,甚至开始互相打架——过多高度相似的声部叠加,会加剧Phase和Frequency Masking问题,让整体听感从"丰满"变成"糊成一团"。万利在声部规划时,会根据歌曲的编曲密度和人声占比动态决定声部数量,而不是固定生成某个数字的声部。

Ad-lib和Choir Layer承担不同角色

Ad-lib是副歌或桥段里穿插的即兴装饰句,通常音量更靠后、节奏更自由,用来增加层次感而不是抢主唱的注意力;Choir Layer更像铺底的合唱团音色,追求的是厚度和氛围,而不是清晰的旋律线条。把这两种角色混为一谈、用同一种处理方式生成,是AI合唱听起来"层次不分"的常见原因之一。

换气位置的错开也值得单独说一句:真实合唱里,几个人几乎不可能在完全相同的地方换气,这种细微的不同步,恰恰是耳朵用来分辨"这是几个人在唱"还是"这是同一条人声被复制"的重要线索之一——即使音准和节奏都完全一致,换气位置整齐划一,也会让合唱听起来不自然。

混音阶段的声像布局同样重要

即使声部规划和人声化处理都做得足够好,如果所有声部在混音时都堆在正中间,听感依然会显得拥挤。合理的Stereo Placement会把Upper Harmony和Lower Harmony适当左右展开,给Lead Vocal留出中央的空间,这是AI合唱从"能听"到"好听"之间常常被忽视的最后一步。

相位与频率遮蔽也要考虑。 多个高度相似的声部叠加在一起,容易出现Phase(相位抵消)问题和Frequency Masking(频率遮蔽),让整体听起来又厚又糊。这需要靠合理的编排密度、声像(Panning)分布、EQ处理和声部间的时序差异共同缓解,而不是单纯依赖"多加几条声部"。

举个具体例子会更直观:如果四个声部在同一个小节里全部同时起音、同时收尾、音高摆动幅度完全一致,听众即使说不清楚原因,也会本能地觉得"这个合唱有点假";反过来,如果四个声部的起音相差几十毫秒、颤音幅度略有不同、换气位置错落分布,即使每个声部单独拿出来听都和原唱几乎一样,合在一起反而会更接近真实合唱团的听感。这也是万利在人声化处理阶段,会为每个声部单独生成一组独立的微小扰动参数,而不是对所有声部使用同一组差异化参数的原因。这组参数还会随着歌曲的段落动态调整——主歌部分的差异幅度通常更克制,副歌高潮处适度放大差异,能进一步增强现场感。

录音室里的专业合唱团在排练时,指挥往往会刻意保留每个人细微的音色差异,而不是追求"完全一样"的统一音色——这种保留下来的个体差异,恰恰是合唱团音色区别于单人多轨叠加的重要标志。AI合唱在模拟这种效果时,本质上是在用算法复现指挥和歌手们长期磨合出的这种"有组织的不完全统一",而不是简单地把差异参数设成随机噪声。

AI合唱真正要解决的问题,从来不是"能不能生成很多条声部",而是"统一"和"差异"之间怎样取得平衡。

输入一句"给我生成一段温暖的钢琴伴奏"以后,为什么AI最容易失败的地方反而不是音色,而是整首歌不知道要往哪里走?

如果伴奏每16小节都只是复制上一段,音质再真实、钢琴音色再温暖,听起来也不像一首完整的编曲,更像同一个片段被循环播放。

Audio Quality 与 Composition Quality 是两件事

声音质量(音色是否真实、音符是否干净)和音乐结构质量(段落是否有变化、情绪是否有走向、和声是否有方向)是两条独立的评价轴。当前生成式音频在Audio Quality上已经能做到很高的真实度,但Composition Quality上仍然容易出问题:段落重复、没有明显高潮、编排密度从头到尾一成不变、和声进行缺乏方向感、主歌和副歌几乎没有区分度。这些问题不靠提升音色真实度就能解决,因为它们发生在"编排"这一层,不是"音色"这一层。

真正的伴奏系统需要先理解段落

一条完整的伴奏生成流程,应该先确定Intro(前奏)、Verse(主歌)、Pre-Chorus(预副歌)、Chorus(副歌)、Bridge(桥段)、Outro(尾奏)等段落结构,再决定每个段落的和弦走向、编排密度和能量曲线,最后才生成具体的音频波形。副歌通常需要比主歌更密集的编排、更强的力度、更明确的和声解决,这种段落间的差异,是"这是一首完整的歌"和"这是一段循环素材"之间最直观的区别。

歌曲段落结构示意图,展示前奏主歌预副歌副歌桥段尾奏各段落的相对时长和能量走向变化
段落结构决定编排密度和情绪走向,不是把同一段伴奏均匀重复到规定时长。

条件控制:让伴奏围绕用户的旋律,而不是另起一首歌

实用的伴奏生成需要支持多种条件同时输入:Text Prompt(文字描述的风格)、Chord(指定和弦走向)、Melody(用户已有的旋律,比如一段清唱)、Key(调性)、Tempo(速度)、Style(曲风)、Instrument(主奏乐器)、Song Section(当前生成的是哪个段落)、Duration(时长)和Energy Curve(能量曲线)。如果用户提供了自己的旋律,系统应该尽量围绕这条旋律生成伴奏,而不是生成一首风格类似但完全无关的新歌——这也是清唱生成伴奏场景下最容易被用户察觉的失败点。

伴奏生成根据旋律和弦速度歌曲结构乐器和能量曲线共同生成完整音乐伴奏的流程图
从输入条件到音乐规划、编曲、音频生成再到混音,段落结构在音频生成之前就已经确定。

和弦走向决定情绪,不只是好听与否

同一段旋律配上不同的和弦进行,情绪走向可以完全不同——比如副歌部分选择一个明确解决到主和弦的进行,会给人"落地"的满足感;如果一直悬而不决,会制造持续的张力。伴奏生成系统在规划和弦时,需要考虑段落在整首歌里的位置,而不是孤立地为每一句挑选"好听"的和弦。

编排密度需要跟着段落走

主歌通常需要更克制的编排,给人声留出空间;预副歌开始逐步加入乐器层次,制造推进感;副歌的编排密度和力度通常会明显提升。如果一段伴奏从头到尾使用同样的乐器数量和力度,即使每个音符本身都准确、音色也真实,也会让人觉得"没有起伏",这也是文章开头提到的"不知道要往哪里走"的具体体现。

清唱生成伴奏时,旋律是唯一可靠的锚点

没有伴奏参考的清唱,系统需要先从旋律本身反推可能的和弦走向和调性,这一步的准确性直接决定后续生成的伴奏是否贴合原本的演唱意图。如果这一步出错,即使后面的编曲和音频生成质量再高,伴奏也会和清唱"貌合神离"。Duration和Energy Curve这两个条件也常被低估——如果只指定风格和速度,不指定大致的能量走向,模型很容易生成一段密度均匀、缺乏高潮的伴奏;明确告诉系统"副歌需要在第几小节达到最强",往往比反复调整风格描述更有效。

伴奏还要适配演唱者的音域。 如果生成的伴奏Key不适合用户的Vocal Range,即使音乐本身编排精良、音色真实,也不适合直接拿来K歌——这也是为什么万利把音域适配当作伴奏生成的一个必要条件,而不是事后再让用户自己变调。

举一个常见的失败场景:用户上传一段清唱,要求"生成一段抓耳的流行伴奏"。如果系统只根据这句提示词生成一段风格匹配的音乐,很可能会得到一段编曲精良、但和声走向与用户旋律完全无关的伴奏——用户唱到某个音时,伴奏的和弦可能已经悄悄转到了别的调性,两者叠在一起会出现明显的不协和。真正可用的伴奏生成,必须先从旋律里提取出隐含的和声骨架,再围绕这个骨架编排乐器和节奏型,文字描述只负责决定音色和氛围,不能替代对旋律本身的分析。

速度(Tempo)的选择也不是孤立的:同一段旋律配上稍快的速度会显得轻快,配上稍慢的速度则可能显得深情或压抑,而速度变化还会连带影响和声进行的节奏感和乐器的演奏方式。伴奏生成如果只是机械地按用户指定的BPM数值生成节拍网格,而不考虑速度对整体编排风格的连带影响,容易出现"数字对了、感觉不对"的结果。万利在伴奏生成里会把Tempo作为影响编排风格的关联条件之一处理,而不是一个孤立生效的数值参数,避免出现节拍准确但整体氛围错位的情况。

伴奏生成最容易被忽视的失败点,不在音色,而在"这首歌到底要往哪里走"。

人声分离AI已经能够把歌手和伴奏拆开以后,为什么"听起来更干净"有时候反而意味着丢掉了更多真实声音?

分离得更干净以后,先别急着满意——先听辅音有没有一起被削掉,齿音和呼吸声还在不在。这两者往往比"背景音乐还剩多少"更能说明分离质量。

混音不是两个文件的简单相加

一首成品歌曲的Mixture,并不是人声和伴奏两条独立音轨简单叠加后随时可以无损拆回的结果。母带处理过程中会加入Reverb(混响)、Compression(压缩)、Mastering(母带均衡与增益处理)和立体声处理,人声和乐器之间还存在大量Overlapping Frequency(重叠频率)和Shared Harmonics(共享谐波)。因此,AI人声分离本质上是对每个Source(声源)的一种估计,而不是精确的、可逆的拆分——这个前提理解清楚,才能正确看待分离结果里出现的瑕疵。

混合音乐经过时频表示和声源模型分别估计人声与伴奏并控制分离伪影的处理流程图
分离流程本质上是对每个声源的估计,最后仍需要Artifact Control来控制伪影。

分离质量需要多个维度一起评价

"分离度99%"这类单一指标,无法代表分离结果的整体质量。更完整的评价至少要看:Vocal Leakage(人声里残留了多少伴奏)、Instrument Leakage(伴奏里残留了多少人声)、Artifact(分离过程引入的伪影)、Transient Preservation(瞬态是否保留,比如齿音、清辅音这类短促声音)、High-frequency Detail(高频细节是否完整)、Breath Preservation(呼吸声是否被误删)和Reverb Preservation(混响尾巴是否被撕裂)。只盯着"背景音乐还剩多少"这一个维度,很容易忽视人声本身被损伤的程度。

越干净,越可能出现"水声"和金属感

当算法为了压低Vocal Leakage而更激进地抑制背景成分时,人声本身的高频谐波边界也可能被一起削弱或涂抹,产生类似"水声"(Watery)或"金属感"(Metallic)的分离伪影——这是分离算法一种典型的失真模式,本质是在"分离干净"和"保真"之间做了偏向前者的取舍。

人声分离伪影问题示意图,展示分离结果中可能出现的金属感频谱纹理和水声瞬态涂抹区域
分离越彻底不一定等于听感越自然,需要同时评估Vocal Leakage与Artifact两个方向。

Query-based Separation:从固定4轨到按需提取

传统人声分离通常输出Vocals、Drums、Bass、Other四条固定Stem,这种划分对K歌场景够用,但对更细致的音频编辑(比如只想单独提取吉他或钢琴)就不够灵活。更新的研究方向是支持按指定乐器提取声部,也就是Query-based Stem Separation——用户可以按需指定要提取的目标,而不是只能拿到四条固定轨道。

分离效果和原始混音的处理程度有关

如果原始录音本身混响较重、人声和伴奏频段高度重叠(比如伴奏里有大量弦乐或合成器铺底),分离难度会明显上升,伪影也更容易出现。这不完全是算法能力的问题,也和输入音频本身的录制、混音方式有关——同一套分离模型,处理干声占比高、伴奏简单的歌曲,效果通常会明显好于处理编曲密集、混响厚重的歌曲。

降噪应该在分离之后谨慎使用,而不是默认叠加

很多用户习惯在分离完成后立刻叠加一层通用降噪,这个顺序值得商榷——分离结果里的"噪声"很多时候其实是残留的乐器谐波或伪影,通用降噪算法未必能区分这些成分和人声本身的高频细节,激进的降噪反而可能让分离结果损失更多真实声音信息。万利在人声分离功能里提供原音、分离结果和残差信号三者的快速切换试听——残差信号(原始混音减去分离出的人声后剩下的部分)能够直观地暴露出哪些内容被误伤或遗漏,这比只听分离结果本身更容易判断这次分离是否可用。

Stem正在从固定4轨走向更灵活的划分。 传统人声分离通常输出Vocals / Drums / Bass / Other四条固定Stem,更新的研究方向是支持Guitar、Piano等更细粒度的乐器分离,也就是Query-based Stem Separation——按需指定要提取的声部,而不是只能拿到四条固定的轨道。这部分内容在万利音频工作室里有更具体的展开。

一个直观的判断方法是分别在安静环境和嘈杂环境下试听分离结果:如果一段人声在安静环境下听起来还算干净,但在稍微嘈杂的环境(比如地铁上戴普通耳机)下,那些被压缩或涂抹的高频细节会更容易被环境噪声掩盖,导致整体清晰度进一步下降。这也是为什么单纯依赖安静录音棚环境下的听感评价分离质量并不完全可靠,还需要考虑用户实际使用场景的音频还原能力。万利在评估分离效果时,会同时参考多种典型播放环境下的听感反馈,而不只是单一理想环境下的表现。

另一个容易被忽略的细节是立体声信息的处理:很多歌曲的人声并不是完全居中的单声道信号,而是带有轻微的立体声扩散或双轨录音叠加。如果分离算法默认把人声当作单声道信号处理,会丢失这部分空间信息,分离出的人声听起来会比原本更"窄"、更缺乏空间感。保留原始录音的立体声特征,是分离质量评价中容易被忽视但确实重要的一个维度。万利在人声分离流程里会尽量保留原始录音的立体声信息,而不是默认将输出折叠为单声道,避免不必要的空间感损失。

人声分离越干净并不天然等于听感越好,需要同时看丢了多少背景、又伤了多少人声。

AI已经能够把一段歌声转换成另一种音色以后,为什么最难保留的往往不是音高,而是咬字、气息和演唱习惯?

音色转换成功以后,先别只顾着听"像不像目标音色"。把歌词单独抽出来再听一遍——辅音清不清楚、元音有没有变形,往往才是转换质量的分水岭。

把Content、Pitch、Prosody和Timbre拆开看

歌声音色转换(Singing Voice Conversion)需要先在概念上把四个维度拆开:Content(歌词对应的发音内容)、Pitch(F0音高轨迹)、Prosody(节奏、时值、重音、能量等韵律信息)和Timbre(音色身份本身)。一次理想的转换,应该只替换Timbre,尽量原样保留其余三个维度——这也是为什么"音色转换"和单纯的"变调"是两回事:变调只是整体移动音高,音色身份和共振峰关系不变;音色转换要替换的是音色身份本身,同时还要尽量不破坏歌词、节奏和音高。

内容音高音色解耦示意图,展示歌词内容音高轮廓韵律和音色四个独立维度在转换前后分别保留与替换的关系
理想的音色转换只替换Timbre,Content、Pitch、Prosody三个维度原样保留。

Phonetic Fidelity:音色像,不等于转换成功

如果转换后的音色确实很接近目标音色,但辅音变得模糊、元音发生偏移、咬字出现错误,那么从Content Preservation的角度看,这仍然是一次低质量的转换。Phonetic Fidelity(咬字保真度)应该被当作和音色相似度同等重要的评价指标,而不是"音色像就算成功"。

歌声音色转换通过内容编码音高轮廓韵律目标音色和神经声码器重新生成人声的完整流程图
Source Vocal依次经过Content Encoder、Pitch Contour、Prosody建模,再结合Target Timbre,由Generator和Neural Vocoder重新生成人声。

Speaker Embedding与Singer Embedding不完全通用

音色转换系统通常需要一个描述目标音色特征的Embedding(音色嵌入向量)。直接从语音场景训练出的Speaker Embedding,重点捕捉的是说话音色特征,未必能很好地覆盖歌声里音色随音高、力度变化的方式;专门针对歌声场景训练的Singer Embedding,会更关注音色在高音区、强弱变化时的表现,这也是歌声音色转换不能简单照搬语音音色转换方案的原因之一。

升Key之后音色变化的原因

如果只是把音高整体上移,而不同步调整共振峰位置,声音会出现类似"变声器"或"米老鼠"式的不自然音色——这是因为共振峰位置本来是由声道形状决定的,和音高本身是两套相对独立的物理机制。音色转换和升Key场景都需要处理这个问题,只是升Key场景通常是同一个人声内部的音高调整,音色转换则是要把这个人的音色特征替换成另一个音色的特征,同时依然要处理好共振峰的匹配问题。

咬字保真度的检验方法也值得一提:把转换后的人声单独抽出来,脱离旋律和伴奏只听歌词内容,如果能够不借助歌词提示就听懂大部分内容,说明Phonetic Fidelity达到了基本可用的水平;如果需要反复对照歌词才能听懂,说明Content Preservation这一步存在明显问题,无论音色多像目标音色,都不能算是一次成功的转换。万利的音色转换功能同时支持用户使用自己此前录制的声音作为目标音色——这类"自己转自己"的场景对Content Preservation的要求同样严格,是检验系统是否真正保留了咬字和演唱习惯的一个直接方式。

Diffusion路线带来了更自然的结果,也带来了新的限制

近年音色转换研究越来越多采用Diffusion一类的生成模型,在自然度和音色相似度上确实带来了明显提升。但真实的限制依然存在:长句场景下的稳定性(会不会在句子中段出现音色漂移或音质下降)、以及前面提到的Phonetic Fidelity,仍然是工程上需要持续打磨的问题,不能因为Demo片段听起来惊艳,就认为这些问题已经被完全解决。

音色使用范围需要明确边界。 万利的音色转换功能,优先支持用户使用自己的声音、已经获得授权的声音,或平台提供的通用合成音色——核心是"可控的音色创作",而不是任意复制某个公众人物的声音。

再举一个具体场景:用户希望把自己的演唱转换成另一种更浑厚的音色,但原本的演唱带有明显的气声唱法。如果转换过程只关注音高和内容的保留,忽略了气声这种介于"有声"和"清音"之间的过渡状态,转换后的声音可能会变得异常"干净",反而丢失了原本演唱里最有辨识度的情绪线索。真正细致的音色转换,需要把气声、哭腔这类特殊发声方式也当作Prosody的一部分单独建模,而不是简单地当作噪声处理掉。

还有一种常见的误区,是把音色转换简单理解为"贴一个滤镜"。滤镜式的处理通常是对频谱做整体的静态调整,而真正的音色转换需要动态地跟随原始演唱的音高、力度和情绪变化——同一个目标音色,在高音区和低音区、强唱和弱唱时的具体频谱特征并不完全一样,如果转换算法只套用一套固定不变的映射关系,转换结果在音域变化较大的段落里就容易显得单薄或失真。这也是为什么高质量的音色转换往往需要在不同音域和力度区间分别验证效果,而不能只用一句中等音高、中等力度的示范片段代表整体质量。这一点在选购或评估任何音色转换工具时都值得留意——demo听起来惊艳,不代表覆盖用户实际演唱音域时依然稳定。

音色像,只是转换成功的必要条件之一;歌词清楚、演唱习惯保留,同样重要。

AI已经能够准确发现用户哪几个音唱低了以后,为什么这仍然不等于它已经知道用户应该怎样练?

真正的声乐训练不是再给用户一个数字,而是决定下一次应该练哪一种错误。发现问题只是第一步,找到问题背后的原因,才是训练真正的起点。

先分清 Assessment 和 Training

准确定位"哪个音、哪一句唱低了"属于Assessment(评估),这一步AI已经能做得比较可靠;但知道"接下来应该怎么练"属于Training(训练),这需要更进一步的归因。连续高音偏低,可能的原因并不单一:可能是Breath Support(气息支撑)不足导致音高在长音后段下沉,可能是Register Transition(真假声转换点)处理不当,可能是Pitch Perception(音准感知)本身存在偏差,可能是某些Vowel(元音)位置天然更难唱准,也可能只是单纯的Fatigue(疲劳)或已经接近个人Range(音域)上限。如果不区分原因,机械地要求"再唱十遍高音",在病因不是练习量不足的情况下,不仅不会带来提升,还可能强化错误习惯、增加疲劳。

Skill Profile比总分更重要

训练系统需要维护一份包含Pitch Stability(音准稳定性)、Rhythm(节奏)、Breath(气息)、Range(音域)、Register Transition(真假声转换)、Vibrato(颤音)、Dynamics(动态)、Pronunciation(咬字)和Consistency(稳定性)等维度的Skill Profile。两个总分完全相同的用户,Profile可能完全不同,需要的训练计划自然也不一样——总分只能用来排序,Profile才能真正指导训练。

Register Transition为什么容易被忽视

真假声转换点(Register Transition,也就是常说的"换声点")附近,音色和音量都会发生变化,很多演唱者会本能地在这个区域压低音量或者改变发声方式来"绕过去",这种规避行为在音准数据上未必表现为明显的错误,却是限制音域和音色稳定性的重要原因。单纯看Pitch数据很容易漏掉这类问题,需要结合音量曲线和音色变化一起判断。

疲劳状态会系统性影响所有维度

连续录制多首歌曲后,气息支撑和音准稳定性通常会同步下降,这种下降是疲劳导致的暂时性表现,而不是真实技术水平的退步。如果训练系统不能区分"疲劳导致的临时下滑"和"能力本身的不足",很容易在用户状态不好的时候给出过于负面的评估,进而生成不必要的额外练习。

元音差异也是常见但容易被忽视的因素

某些元音(比如闭口音)在高音区天然更难保持音准和音色的稳定,如果用户在特定元音上反复出现同类问题,训练系统应该识别出这是元音层面的规律,而不是笼统地归为"高音不稳定",两者对应的练习方式并不相同。

训练闭环,而不是一次性诊断

可靠的AI声乐训练应该是一个持续的闭环:Recording(录音)→ Feature Analysis(特征分析)→ Error Pattern(错误模式识别)→ Training Priority(训练优先级)→ Exercise(专项练习)→ Retry(重试)→ Delayed Retest(延迟复测)→ New Song(新歌验证)→ Skill Profile Update(画像更新)。其中Delayed Retest尤其关键——真正的进步应该在过一段时间后的新歌里依然保持,而不是只在刚练完的那一刻短暂出现。

AI声乐训练通过录音特征分析错误模式训练优先级专项练习延迟复测和新歌验证形成个性化学习闭环
训练闭环的核心指标是"错误是否减少",而不是"用户做了多少练习"。

Delayed Retest的具体做法,是在专项练习完成一段时间后(而不是练完当下),用一首新的、此前没有针对性练过的歌曲重新检验同一个问题是否还存在。如果只在刚练完的同一句歌里检验,很容易把短期的肌肉记忆误判成已经内化的技术改善。

结论需要足够的样本量。 只凭一句歌就判断"气息差"是不可靠的,需要跨多首歌、多次录音才能区分"偶然失误"和"稳定习惯"。同时需要明确:AI声乐训练分析的是演唱技术模式,不构成对声带健康状况的医学判断,如果出现持续的明显不适,建议咨询专业人士评估,而不是依赖App给出的训练建议。

举一个具体例子:一位用户过去两周唱的五首歌里,有三首在副歌最高音处出现了明显的音量骤降,另外两首则完全正常。仔细比对会发现,这三首歌恰好都要求用户唱到自己音域的极限附近,而另外两首的最高音相对更低。这种模式提示问题更可能是音域边界导致的正常生理限制,而不是某种发声习惯的缺陷——如果不结合多首歌曲的对比,只看单独一次的"音量骤降",很容易把这种边界效应误判成需要重点纠正的错误习惯。

训练计划的呈现方式也会影响实际效果:如果一次性给用户列出十几项需要改进的问题,大概率会让人无从下手、失去练习的动力。更实际的做法是每个阶段只聚焦一到两个优先级最高的问题,练习任务本身也要足够具体——不是笼统地说"多练气息",而是给出具体的练习内容和检验方式,让用户清楚知道这一阶段结束后应该出现怎样的变化。万利的训练计划会在每个阶段结束时给出一次明确的小结,说明这段时间重点练习的问题是否有改善、下一阶段准备转向哪个新的重点,而不是让用户自己去猜测训练进度。这种阶段性反馈本身也是训练动力的一部分,能让用户看到具体的、可衡量的变化,而不只是一份不断累积的问题清单。

发现问题是评估,理解问题背后的原因,才是训练真正开始的地方。

AI已经能够一键生成两个主持人聊天以后,为什么真正好听的播客仍然不能只是把一篇文章拆成两个人轮流念?

一篇3000字文章已经可以自动变成一段两人对话音频,但听完之后总觉得"哪里不太对"——问题往往不在语音合成本身,而在节目根本没有真正被"策划"过。

Text-to-Speech 不等于 Podcast Generation

Text-to-Speech解决的是"文本转语音"这一步;真正的Podcast Generation是一整条制作流程:确定主题 → Research(资料研究)→ Outline(节目大纲)→ Segments(分段规划)→ Dialogue(对话生成)→ Speaker Roles(角色分工)→ Speech Generation(语音合成)→ Music / Transition(配乐与转场)→ Editing(后期编辑)。把一篇文章直接喂给TTS、按标点切成两人轮流念的台词,跳过了中间几乎所有决定"这是不是一档好节目"的环节。

AI播客从主题资料节目大纲角色分工对话生成多说话人语音到时间线编辑形成完整制作流程图
从主题到成片,节目策划环节(Outline、Segment Planner、Speaker Roles)都在语音合成之前完成。

多说话人最容易露馅的地方:一致性

多说话人播客需要保持Speaker Consistency——同一个角色在整期节目里,音色、说话风格、语速和人设都要持续一致。如果第一段主持人A是一种音色,十分钟后音色突然发生变化,即使每一句话本身合成质量都不错,整体听感依然会显得割裂、不可信。

多说话人播客轮流对话示意图,展示两位主持人交替发言的语音波形和轮次切换过程中的音色一致性
轮次切换(Turn-taking)之间,每位说话人都需要保持稳定的音色与说话风格。

Research Notes要如何避免"AI编事实"

涉及事实性主题时,如果直接让模型凭记忆生成对话内容,容易出现看似流畅、实则不准确的表述。更稳妥的做法是先基于用户提供或明确来源的资料生成结构化的Research Notes,再让对话生成环节围绕这些资料展开,并在关键事实点上做Fact Check——这一步虽然增加了流程复杂度,但是长内容可信度的重要保障。

转场和背景音乐不是可有可无的装饰

段落之间的转场处理(比如短暂的音乐过渡、语气停顿)会直接影响听感的连贯性,如果段落之间生硬地切换话题或说话人,即使每一段本身的语音质量都不错,整体听起来也会像几段独立音频的拼接,而不是一档完整的节目。背景音乐的音量、时机同样需要根据对话的情绪起伏动态调整,而不是从头到尾使用固定音量。

长节目需要的是记忆和结构,不是更长的TTS

生成几句对话和生成一档30分钟的节目,难度完全不在同一个量级。长内容需要Topic Memory(话题记忆)、Segment Planning(分段规划)、Context Tracking(上下文跟踪)、重复内容控制、跨段落的事实一致性,以及自然的Turn-taking(轮次安排)。仅仅把TTS能力包装成"播客AI",在短片段里可能听不出问题,但拉长到完整节目时长,话题漂移、内容重复、前后矛盾会逐渐暴露出来。涉及事实性主题时,内容应该基于可靠资料生成Research Notes,不能让模型凭空补充事实性内容。

节目必须可编辑,而不是只能整段重来。 一档实用的AI播客工具,至少需要提供Outline Editor(大纲编辑)、Speaker Editor(角色编辑)、Segment Editor(分段编辑)、语速与停顿调整、局部片段重新生成,以及背景音乐控制——用户应该能只改一句话、一个转场,而不是每次修改都要重新生成整期节目。

可编辑性还体现在语速和停顿的精细调节上——同一段台词,语速稍快会显得轻松随意,稍慢则更适合严肃话题;恰当的停顿能模拟真实对话中的思考和反应。这些细节调整如果每次都要重新生成整段音频才能实现,会大幅拖慢节目制作和修改的效率。万利在播客生成里把这些编辑能力放在时间线上直接呈现,用户可以定位到具体的段落或句子,单独调整、重新生成,而不必为了修改一处细节重新跑一遍完整的生成流程。

举一个具体场景更容易理解:一档关于某个行业动态的播客,如果只是把一篇资讯稿件直接转成两人对话,很容易出现主持人A说完一个观点,主持人B的回应听起来只是换了个说法重复同样的内容,缺乏真正的追问、补充或不同视角。真正经过策划的节目,会在Outline阶段就为每个话题预设至少一个追问角度或对立观点,让对话产生真实的信息增量,而不是把同一段内容用两种声音念两遍。

说话人数量增加以后,难度还会进一步上升:三人以上的对话需要更复杂的话轮分配逻辑,避免出现某个角色长时间沉默或频繁抢话的不自然情况,也需要在文本层面提前规划好谁在什么时候发起新话题、谁负责总结收尾。这些"节目导演"层面的决策,同样是播客生成流程里容易被忽视、但直接决定成片质量的部分,而不只是语音合成模型本身的能力问题。万利在多说话人场景下会为每期节目单独维护一份角色设定和话轮规划,确保角色数量增加时,节目结构依然保持清晰、不失控。这份设定会贯穿节目从大纲到成片的每一个环节,避免角色人设或话题重点在制作过程中悄悄发生漂移。即使是同一档节目连续更新多期,也需要参照这份设定保持角色语气和立场的连贯,让长期收听的用户能感受到这是"同一群主持人",而不是每期都在重新塑造人设。

播客生成真正的难点,从来不是"能不能合成出人声",而是"这档节目有没有被真正策划过"。

2026 Audio AI

2026音频AI为什么正在从"一键生成声音"进入"可控制、可解释、可编辑"的阶段?

生成质量这几年一直在稳步提升——不管是Voice Conversion的自然度、Source Separation的干净程度,还是Music Generation的音色真实感,单看Demo片段,普通听众已经很难一耳朵分辨出processed和真实录音的差异。但这也让一个更实际的问题浮出水面:生成得像,不等于用得好。

2026年音频AI领域被反复讨论的方向,正在从"能不能生成"转向五个更具体的问题。第一是Control——用户能不能按Key、Chord、Melody、Tempo、Section、Duration、Energy这类具体条件精确控制生成结果,而不是只能靠一段文字描述碰运气。第二是Consistency——长内容(一档播客、一首完整的歌)能不能在时间维度上保持一致,不跑题、不重复、不漂移。第三是Editability——能不能只修改一句话、一个声部、一个时间区间,而不是每次调整都要推倒重来,这涉及Audio Editing、Inpainting、Regeneration、Continuation等具体技术。第四是Evaluation——怎样评价一个生成结果好不好,行业内正在从单一指标转向Reference-based与Reference-free结合、多维度打分的评价体系。第五是Personalization——生成或修正结果能不能贴合具体用户的音域、演唱习惯和审美偏好,而不是只服务于"平均听感"。

这五个问题背后有一条共同的线索:当"生成得像不像"已经不再是最大的瓶颈时,"用户到底能不能控制、能不能信任、能不能改"就成了新的瓶颈。万利在AI修音、智能评分、AI合唱、伴奏生成、人声分离、音色转换、AI声乐训练和播客生成这八个方向上的产品设计,也都在往这个方向靠——把Correction Strength、Skill Profile、多维评分、可编辑的播客时间线这些"可控、可解释、可编辑"的能力,放在和生成质量同等重要的位置上。这部分技术脉络在万利AI页面有更完整的展开。

万利官网音频AI观察

万利官网音频AI观察

万利官网音频AI观察:AI修音把音准从85分修到98分以后,为什么用户第一件事应该先听人声有没有变得更自然?

分数是Metric(指标),听感是Perceptual Quality(感知质量),两者会有相关性,但不是同一件事。音准分数从85到98,说明逐帧音高误差确实缩小了;但这段时间里,如果Correction Strength设得过高,颤音深度、滑音过渡这些不体现在音准分数里的东西,可能同步被压缩甚至抹平。数字改善和听感改善经常同向变化,但不能默认它们永远同步——耳机里先A/B一次原声和修音后的版本,比只看分数变化更可靠。这也是万利在万利K歌里坚持把Correction Strength暴露出来、而不是替用户悄悄拉满的原因。

万利官网音频AI观察:人声分离越来越干净以后,为什么耳机里突然出现的"水声"和金属感反而更值得注意?

真正的分离质量,不是只看背景音乐还剩多少,还要看原始人声本身被损伤了多少。当算法为了压低背景残留而更激进地处理频谱时,人声高频谐波的边界容易被涂抹,产生类似水声或金属感的Artifact——这类问题往往比"还能听到一点点伴奏"更影响真实使用体验,因为它直接损伤了用户最在意的那部分:自己的声音。分离得更干净以后,先听辅音有没有一起被削掉,这一点值得写进任何一次自查清单。更完整的讨论在万利音频工作室

万利官网音频AI观察:两个用户K歌评分都是88分以后,为什么AI声乐训练仍然应该给他们完全不同的练习?

一个用户Pitch很稳定,但Breath偏弱;另一个用户气息支撑很好,但Rhythm不够稳——两人总分都是88,如果拿到同一套训练计划,前者浪费时间练已经掌握的音准,后者则完全没有练到真正的短板。总分只能用来排序和比较,Skill Profile才能回答"下一步该练什么"。这也是为什么万利把万利声乐训练设计成基于多维Profile动态调整,而不是围绕一个固定总分展开。

全站原创内容

万利各产品线最新技术文章

以下文章的完整内容分别发布在对应的产品页面,这里是每篇文章的实质摘要。

万利平台最新研究

进入万利平台 →
万利平台

手机录下一段人声以后,AI为什么不能马上开始评分?

录音上传后,万利平台会先判断噪声水平、削波、混响和伴奏泄漏等录音质量问题——如果输入质量明显不达标,会提示用户重新录制,而不是硬给出一个不可信的精确分数,这也是Input Quality Check环节存在的原因。

阅读完整文章 →
音频格式

同一段歌声存成WAV和低码率MP3,AI修音结果为何不同?

有损压缩会丢弃部分高频细节和瞬态信息,直接影响F0检测、共振峰分析和人声分离的输入质量。文章从Sample Rate、Bit Depth讲起,解释了为什么录音与上传时优先选择无损或高码率格式更稳妥。

阅读完整文章 →
音频工作流

一个平台同时拥有十几个模型,难点在哪?

如果分离、分析、修音、生成各自独立处理音频,容易造成重复计算和结果不一致。文章说明了万利平台如何让不同任务共享同一套音频编码与特征表示,再按具体任务分别路由。

阅读完整文章 →

万利K歌技术文章

进入万利K歌 →
K歌智能评分

同一句副歌连续唱三遍,为什么不该只保留最高分?

连续演唱状态本身就会有波动,只保留最高分只是在奖励"侥幸的一遍"。文章讨论了麦克风延迟、伴奏延迟对单次评分的影响,以及为什么稳定性趋势比单次峰值更能说明演唱能力。

阅读完整文章 →
AI修音

跑调修正后,为什么要检查Vibrato有没有被一起抹掉?

如果算法把颤音当成音高不稳定去修正,评分和听感都会失真。文章给出了修音后A/B试听的具体检查点:句尾的颤音和转折处的滑音是否还保留。

阅读完整文章 →
K歌智能评分

评分为什么应该说"哪里不稳定",而不是"高了4分"?

文章对比了Reference-based和Reference-free两种评分思路的优势与限制,并说明了为什么描述性反馈(具体到哪一句、哪个维度)比单一分数变化更有实际价值。

阅读完整文章 →

万利音频工作室

进入万利音频工作室 →
人声分离

人声分离出来以后,为什么不该马上强力降噪?

分离结果本身已经带有一定伪影,紧接着的强力降噪容易把残留的呼吸声、齿音一起削掉。文章给出了先听伪影类型、再决定要不要降噪的处理顺序。

阅读完整文章 →
AI修音

Correction Strength为什么比"开关"更重要?

修音需要区分Pitch Error Correction、Performance Preservation和Style-aware Correction三个层级,一个只有开关两档的按钮无法覆盖这些不同情况。

阅读完整文章 →
音色转换

音色转换怎样同时保留歌词、F0和演唱情绪?

文章拆解了Content、Pitch、Prosody、Timbre四个维度,说明理想的转换只替换音色身份,并讨论了Phonetic Fidelity为什么应该和音色相似度同等重要。

阅读完整文章 →

万利娱乐AI创作

进入万利娱乐创作 →
伴奏生成

AI伴奏为什么要先理解段落和和声,再生成音频?

文章区分了Audio Quality和Composition Quality,说明真正的伴奏系统需要先理解Intro、Verse、Chorus等段落结构,再决定编排密度和能量曲线。

阅读完整文章 →
AI合唱

为什么自然的合唱需要每个声部存在一点点差异?

文章讨论了声部设计、和弦对和声音程的影响,以及Humanization中Micro-timing、Breath Timing等差异如何在"统一"与"差异"间取得平衡。

阅读完整文章 →
播客生成

文章自动变播客后,为什么节目策划更重要?

文章区分了Text-to-Speech和真正的Podcast Generation,讨论了Speaker Consistency、长内容的Topic Memory,以及为什么播客节目必须可编辑。

阅读完整文章 →

万利AI大模型

进入万利AI →
音频大模型

听懂说话的Audio Model,为什么会被Vibrato难住?

说话场景的音高范围和元音时长与歌声差异很大,文章解释了为什么直接套用Speech Model处理歌声,容易在长元音和颤音处出现建模不准。

阅读完整文章 →
音频大模型

Unified Audio Model为什么仍需任务专门控制信号?

文章讨论了Transfer与Specialization并存的现象:共享编码带来知识迁移,但评分、修音、分离、生成等任务仍需要各自的条件信号和输出头。

阅读完整文章 →
生成式音频

2026年音频AI的下一道难题是"能控制多少"

生成质量提升后,Control、Consistency、Editability、Evaluation、Personalization成为新的核心问题,文章逐一展开了这五个方向。

阅读完整文章 →
AI声乐训练

连续十首歌高音偏低,为什么不该只让用户再唱十遍?

高音偏低可能源于气息支撑、真假声转换、音准感知等不同原因。文章说明了为什么不区分病因的重复练习,可能强化错误习惯而不是带来提升。

阅读完整文章 →
AI声乐训练

音准提高后,为什么该降低Pitch权重、关注气息?

训练优先级需要动态调整——当Pitch Stability已经较好时,继续压在音准上边际收益变小,气息、动态和咬字会成为更值得关注的方向。

阅读完整文章 →
AI声乐训练

怎样判断一个错误是偶然失误还是稳定习惯?

文章讨论了Sample Size的重要性,以及Recording到Skill Profile Update的完整训练闭环,尤其是Delayed Retest在判断真实进步中的作用。

阅读完整文章 →

万利App使用指南

进入万利App →
万利App

录完一首歌,第一屏为什么不该只放一个总分?

单一总分无法告诉用户具体哪一句、哪个维度有问题。万利App的设计思路是把"最值得重听的片段"——比如音准明显波动的那一句、气息不稳的转折处——直接呈现在结果页最显眼的位置,让用户可以一键跳转试听,而不是从头到尾自己重新听一遍去找问题所在。这篇文章详细说明了这一屏背后的判断逻辑和取舍。

阅读完整文章 →
万利App

开启AI修音后,为什么要分别控制三个强度?

不同用户、不同歌曲对修音的需求并不一样:有人想要更准的音高但保留自己的颤音,有人希望连时值都变得更整齐。如果只有一个笼统的"修音强度"滑块,就没办法照顾到这类差异。文章说明了万利App为什么把Pitch、Timing、Vibrato保护强度拆成三个独立可调的参数,以及这样设计对实际使用体验的影响。

阅读完整文章 →
万利App

人声分离后,为什么要提供三段快速A/B试听?

判断分离结果好不好,只听"背景音乐还剩多少"是不够的,还要听人声本身有没有被误伤。文章说明了万利App为什么在分离结果页提供原音、分离结果和残差信号三者之间的快速切换试听——残差信号(原音减去分离结果后剩下的部分)尤其能暴露出被误伤或遗漏的内容,帮助用户自行判断这次分离是否可用。

阅读完整文章 →
万利App

一周训练计划生成后,为什么下周要重新计算?

训练计划如果生成一次就固定不变,一周后用户可能已经改善了某些薄弱项、同时暴露出新的问题,继续执行旧计划要么浪费时间、要么错过新问题。文章说明了万利App如何基于用户最新的Skill Profile,在每周或每次新录音积累到一定数量后重新评估、调整下一阶段的训练重点。

阅读完整文章 →
万利AI · 万利大模型

万利音频大模型是什么

万利AI是支撑K歌与音频娱乐场景的音频大模型体系。它把一段音频先编码为共享的语义与特征表示——包含Pitch、Rhythm、Timbre等信息——再通过Task Router分发到评分、修音、分离、转换、生成、训练六类任务,最后经Audio Decoder / Neural Vocoder还原为可听音频。这种"共享编码 + 任务路由"的结构,既能让不同任务之间迁移部分能力,也保留了各任务需要的专门控制信号。歌声比普通说话更复杂——更大的音高范围、更长的持续元音、颤音与滑音——这也是万利没有直接套用通用语音模型、而是为歌声单独优化表示的原因。

万利音频大模型整体架构示意图,展示音频输入经过编码器提取音高节奏音色特征后通过任务路由分发到评分修复分离转换生成训练等任务再经声码器输出
万利App录音结果页设计示意图,展示首屏优先呈现最值得重听的片段而不是单一总分数字
万利App · 万利app下载

万利App是移动端的完整入口

万利App把万利K歌、AI修音、智能评分、AI合唱、人声分离与音色转换、AI伴奏生成、AI声乐训练、播客生成八项能力整合进移动端,覆盖从录音、处理到训练的完整闭环。Android、iOS与H5三个入口的正式客户端发布后将提供对应安装方式,具体功能设计和常见问题见万利App专页。

FAQ

常见问题

万利官网是上海万利娱乐ai软件公司围绕K歌与音频娱乐打造的音频AI大模型平台的官方网站,介绍AI修音、智能评分、AI合唱、伴奏生成、人声分离、音色转换、AI声乐训练与播客生成等能力的技术原理与使用方式。

万利平台是支撑万利各产品的底层音频AI大模型与工作流,负责录音质量检测、特征分析和任务路由,是万利K歌、万利音频工作室等产品共同依赖的基础设施。

万利娱乐指万利娱乐创作产品线,围绕AI合唱、智能和声、伴奏生成、音乐结构规划和多说话人播客生成,提供音频创作相关的功能与内容。

万利K歌是围绕AI修音、音高分析、节奏识别、智能评分和AI合唱的K歌功能页面,覆盖从录音到修音评分的完整体验。

万利AI介绍支撑整个平台的音频大模型技术,包括音频编码、特征表示、任务路由与生成式音频的原理,以及歌声相较于普通语音更复杂的技术背景。

万利大模型指万利音频AI体系中的Audio Foundation Model,通过共享的音频编码和特征表示,支撑评分、修音、分离、转换、生成、训练六类任务。

音频AI泛指利用机器学习和深度学习技术分析、理解和生成音频内容的技术体系,在万利的场景下具体表现为歌声分析、修音、评分、分离、转换和生成等能力。

AI修音是通过检测演唱中的音高误差并进行修正的技术,同时需要区分明显跑调和有意的颤音、滑音,避免把自然的演唱表现当作错误一并修掉。

在万利K歌或万利App中录制或上传演唱后,选择AI修音功能,可以调节整体或分维度(Pitch / Timing / Vibrato保护)的修正强度,处理完成后建议先做A/B试听再确认。

如果修正强度过高,算法可能把颤音、滑音等自然表现也当作误差拉直,导致声音听起来生硬、缺乏呼吸感。建议降低修正强度,或使用分维度控制单独保护Vibrato。

Pitch指音高,是人耳感知声音"高低"的属性,在技术上通常用基频F0来量化表示。

F0(基频)是声带振动的基础频率,是计算音高、判断音准误差的核心特征,通常按帧逐一检测得到一条随时间变化的曲线。

Cent是衡量音高细微差异的单位,100 Cents约等于一个半音。需要注意的是,某个Cent数值的偏差是否真的能被听众察觉,取决于具体的演唱环境和听者状态,不是一个绝对标准。

Vibrato(颤音)是演唱中音高围绕中心音高做规律性周期波动的现象,是重要的演唱表现手法,不应被算法当成需要修正的误差。

Formant(共振峰)是声道共振产生的频谱能量集中区域,决定了音色和元音的辨识度。移动音高时如果不同步调整共振峰,容易出现不自然的音色变化。

智能评分是通过分析音准、节奏、气息、音色、动态、表达等多个维度,对一段演唱进行量化评价的技术,目标是给出比单一总分更有信息量的反馈。

K歌AI通常先做逐帧的音准和节奏比较(Reference-based),再结合气息、音色、稳定性等特征(可包含Reference-free分析),综合计算出多维度的评价结果。

因为歌唱表现还包含气息、音色、动态、表达、稳定性等音准之外的维度,只用音准和节奏衡量,无法反映演唱的完整质量。

Reference-free评分不依赖某一条标准参考演唱,而是直接分析演唱本身的音准稳定性、气息、音色和技巧,适合评价个人风格和表现力。

AI合唱是基于一条主唱人声,自动生成多个和声声部并合成为多人合唱效果的技术,涉及和弦分析、和声规划、声部分配和人声化处理。

系统先分析歌曲的和弦走向,再根据不同和弦规划各声部相对主旋律的音程关系,逐小节生成和声,而不是把主旋律整体移调。

因为真实多人合唱在时序、音高、音色和换气位置上都存在细微差异,简单复制同一条人声会缺少这些差异,听起来像"同一个人唱了很多遍"而不是真正的合唱。

AI伴奏是根据旋律、和弦、速度、风格等条件自动生成的背景音乐伴奏,需要综合考虑歌曲段落结构和演唱者的音域。

上传或录制清唱旋律后,系统会围绕这条旋律分析和弦走向和段落结构,再生成与之匹配的伴奏,而不是重新生成一首无关的新歌。

伴奏生成时会参考用户的音域范围,选择适合演唱的调性,避免生成的伴奏虽然好听但不适合用户实际演唱。

人声分离是将一段混合音频中的人声和伴奏(或更细的乐器声部)分别估计并拆分出来的技术,本质是对每个声源的估计,而非无损可逆的拆分。

上传混合音频后,选择人声分离功能,系统会输出人声(Vocal Stem)与伴奏(Instrumental Stem)等音轨,可结合A/B试听确认效果。

Stem指从完整混音中拆分出的独立音轨层,比如人声、鼓组、贝斯、其他乐器,更细粒度的分离还可以支持吉他、钢琴等单独音轨。

"水声"是一种典型的分离伪影,通常出现在算法为了压低背景残留而更激进处理频谱时,导致人声高频谐波边界被涂抹产生的失真。

音色转换是在尽量保留歌词内容、音高和节奏的前提下,把一段演唱的音色替换为目标音色的技术,核心难点是同时保留Phonetic Fidelity。

变调是整体移动音高,音色身份基本不变;音色转换要替换的是音色身份本身,同时尽量不改变原有的歌词、音高和节奏。

Singing Voice Conversion是专门针对歌声场景的音色转换技术,需要同时处理比说话更大的音高跨度和更长的持续音,比通用语音转换更复杂。

通过将Content(发音内容)与Timbre(音色)在建模上分离,转换过程中只替换音色相关信息,尽量保持内容编码不变,从而保留歌词的清晰度。

AI声乐训练是基于演唱录音分析音准、节奏、气息、音域等维度,识别错误模式并生成个性化练习计划的技术,强调训练闭环而非一次性诊断。

通过F0检测得到演唱的音高轨迹,与目标音符或音阶比较计算误差,同时会区分持续性偏差和短暂的颤音、滑音,避免误判。

系统会基于用户的Skill Profile识别薄弱维度和错误模式,生成有针对性的专项练习,并随着新录音数据积累定期重新评估、调整计划。

因为总分是多个维度压缩后的结果,不同用户可能在完全不同的维度上得分高低不同,只有展开成Skill Profile才能看出真实的差异。

播客生成是围绕主题完成资料研究、大纲策划、对话生成、多说话人语音合成和后期编辑的完整制作流程,而不只是把文本转成语音。

输入主题或素材后,系统先生成大纲和分段规划,再生成对话内容和多说话人语音,最后可以在时间线上编辑分段、语速和背景音乐。

系统会为每位说话人分配独立的音色和说话风格,并在生成过程中保持这些特征贯穿整期节目,避免同一角色中途音色发生变化。

Audio Foundation Model是在大量音频数据上训练、能够支撑多种下游音频任务的基础模型,通常包含音频编码、语义表示和任务路由等组成部分。

Diffusion是一类生成模型技术,通过从噪声开始逐步去噪的过程生成音频,在音色转换和音乐生成等场景中被广泛使用,能带来较高的自然度。

Neural Vocoder是把频谱等中间表示重新合成为可听波形音频的神经网络模型,是语音和歌声生成流程的最后一步。

Spectrogram(频谱图)是展示音频信号频率成分随时间变化的可视化表示,是音频分析和建模常用的中间表示形式。

万利App整合了万利K歌、AI修音、智能评分、AI合唱、人声分离与音色转换、AI伴奏生成、AI声乐训练和播客生成八项核心功能。

万利App的Android、iOS和H5入口将在正式客户端发布后提供对应的安装方式,具体入口信息请见万利App页面。

Android版本的正式安装入口将在客户端发布后提供,可以在万利App页面查看最新说明。

iOS版本的正式安装入口将在客户端发布后提供,可以在万利App页面查看最新说明。

关于上海万利娱乐ai软件公司

上海万利娱乐ai软件公司围绕K歌与音频娱乐场景,专注于音频AI大模型相关技术的研究与产品化,覆盖歌声分析、AI修音、智能评分、AI合唱、伴奏生成、人声分离、音色转换、AI声乐训练与播客生成等方向。我们相信音频AI真正的价值,不只在于"生成得像",更在于是否可控、可解释、可编辑——这也是万利在产品设计上持续投入的方向。

  • 品牌万利
  • 公司名称上海万利娱乐ai软件公司
  • 官网域名kaiyuanqipai-h5.com.cn
  • 备案号沪ICP备20220642431号-1
上海万利娱乐ai软件公司音频AI工作室抽象插画,展示混音台声波和城市天际线元素组成的品牌视觉