1. 首页 > 游戏攻略

标题:原神“HP5模型”怎么分离人声——资深玩家的实操分享

作者:小小 更新时间:2026-07-25
摘要:第一段,模型本质与诞生背景。很多原神玩家都遇到过同一个烦恼,游戏里角色语音和背景音乐混在一起,想提取一段派蒙的吐槽当铃声却总是带上嘈杂的BGM。所谓的HP5模型并不是官方产物,而是社区里一群音频爱好者基于开源项目重新训练的专用模型。HP5这个名字来源于它采用的HarmonicandPercussiveSeparation第五代改进,标题:原神“HP5模型”怎么分离人声——资深玩家的实操分享

 

第一段,模型本质与诞生背景。

很多原神玩家都遇到过同一个烦恼,游戏里角色语音和背景音乐混在一起,想提取一段派蒙的吐槽当铃声却总是带上嘈杂的BGM。所谓的HP5模型并不是官方产物,而是社区里一群音频爱好者基于开源项目重新训练的专用模型。HP5这个名字来源于它采用的Harmonic and Percussive Separation第五代改进网络,专门针对原神音频中高动态范围的人声和复杂交响乐背景进行优化。简单说它就是一个深度学习的分离器,能把混音中的说话声、歌唱声和乐器音分开,而且对原神里超过两百个角色的音色都有较好的适配性。

第二段,准备工作与工具选择。

动手之前你得先下载两个关键东西。第一个是Ultimate Vocal Remover这款免费的图形界面工具,它内置了模型加载接口。第二个才是HP5模型本体,一个大约800MB的.pth文件,你可以在GitHub上搜“Genshin HP5 Model”找到发布页。注意不要下错版本,原神每次大版本更新后的语音文件采样率略有变化,建议下载标注了3.5或更高版本的模型。另外最好准备一块支持CUDA的NVIDIA显卡,纯CPU模式也能跑但分离一首四分钟的角色演示可能要等半小时。

第三段,操作步骤与参数调整。

打开UVR后点击“Load Model”加载HP5.pth,然后在“Input”处选择你下载好的原神音频文件。我强烈建议用最高质量的无损格式比如FLAC或者WAV,mp3压缩会严重降低分离效果。接着在“Algorithm”下拉菜单里选“HP5 Only”,不要勾选“Ensemble”因为那会消耗更多显存。最关键的一步是“Primary Stem”选“Vocals”,副干“Secondary Stem”选“Instrumental”。点击“Start Processing”后你会看到一绿一蓝两条波形在实时变化,绿色代表正在分离出的人声,蓝色是残留的伴奏。

第四段,常见问题与优化技巧。

如果分离出来的语音里还带着细微的鼓点声,别急着重跑。先检查输入音频中是否包含高强度的低频打击乐,比如周本的音乐里经常有定音鼓。解决办法是把“HP5 Band Split”从默认的250Hz调到400Hz,这样模型会优先保护中高频的声带振动。另外原神角色语音经常夹带混响和延迟效果,分离后听起来可能有点干涩。你可以用Adobe Audition或者免费的Audacity给干声加一点房间混响,参数建议控制在2.5秒衰减、15%早期反射强度。

第五段,实际应用场景与娱乐价值。

我用这个模型把钟离的“此世群魔诸神并起,我虽无意逐鹿”的语音单独拎出来,替换掉了手机导航提示音,每次拐弯听到这句台词都很有代入感。还有朋友用它分离派蒙的焦急呼喊做闹铃,效果比原声带里的钟声更让人精神一振。如果你做原神二创视频,HP5模型更是利器,能把角色对话从大世界探索的脚步声和水流声中完美剥离,音轨对齐的精度能控制在三个采样点以内。不过要注意版权问题,分离出的音频只能个人使用,不要直接上传到商业平台。

第六段,模型局限与未来期待。

HP5模型最大的软肋是处理同时有多个角色对话的场景,比如邀约任务中两个人抢着说话时,分离出来的人声会黏在一起。因为训练数据里大部分是单角色独白,多声源混合样本太少。另外有些特殊音效如雷音权现的电流声会被误判为人声的泛音导致残留,这时候需要手动在UVR里勾选“Denoise Post Process”并设定阈值0.3。社区目前正在训练HP6模型,加入了米哈游最新出的纳塔地区角色语音,据说能分离出更细腻的呼吸声和咬字细节,等到正式发布我再做一次对比评测。

最后一段,给新手的真诚建议。

不用急着追求完美分离参数,先用默认设置跑一遍原神角色演示曲,听听结果是否满意。如果电脑显存不足,可以把音频切成30秒一段处理,拼接时注意用交叉淡入淡出消除接缝。记住任何AI模型都做不到100%无损失,保留一点背景音反而更像现场录音更有烟火气。当你第一次听到派蒙的“旅行者,快醒醒”从原曲里干干净净飘出来时,那种成就感比抽到五星还爽快。