如今,人工智能蓬勃发展,写作的,画画的,做视频的可谓是层出不穷。
人工智能看起来已经是很擅长处理人类的艺术活动了。
但是,有一个艺术类型的发展却远远落在了后面,那就是音乐。
商业性质AI音乐公司的SUNO,Wondera等等的确也创造了不少成绩。
但是相对其他的艺术类型,还是很有局限,
开源领域自然更是发展缓慢了。
不过这种局面有望得到转变,
随着Ace-Step1.5的推出,我们总算得到了一个有实际使用价值的本地模型了。 社区评价,其水平再suno3-4之间,那这已经不错了。
它还支持lora微调,只需要几首或者几十首就能捕获歌曲中的风格特点。
并且它也能够做到SUNO一样的上传歌曲然后覆盖,以不同的风格创作这首歌(就像是图生图)
而且还能选取片段重新生成音乐片段(就像是重绘)
当然,以上功能,comfyui目前还不支持,以后或许会支持。
那么comfyui也是立刻就支持了该模型...
什么?comfyui不是画图的吗?怎么还能做音乐?
(难道我会说它还能搞TTS,给图片打标吗?)
很显然comfyui并不想只局限于画图,而是想要成为当今时代的全能手~
虽然至今都不能用它来进行很好的写作就是了。
当然, 目前comfyui支持的还不是很好,功能还很不完善。
所以我们还可以用官方的代码库:
https://github.com/ace-step/ACE-Step-1.5
Comfyui版本使用方法:
那么首先让我们下载模型:
https://huggingface.co/ACE-Step/Ace-Step1.5/tree/main
然后更新comfyui以及库到最新版本:
Comfyui : https://github.com/Comfy-Org/ComfyUI
库1:comfyui路径/python文件夹/python.exe comfyui路径/python文件夹/Scripts/pip.exe install --upgrade comfyui-frontend-package
库2:comfyui路径/python文件夹/python.exe comfyui路径/python文件夹/Scripts/pip.exe install --upgrade comfyui-workflow-templates
库3:comfyui路径/python文件夹/python.exe comfyui路径/python文件夹/Scripts/pip.exe install --upgrade comfyui-embedded-docs 下载工作流:
https://github.com/Comfy-Org/workflow_templates/blob/main/templates/audio_ace_step_1_5_checkpoint.json
comfyui提供的工作流程技巧: 风格标签 :请尽可能详细地描述!包括流派、乐器、情绪、节奏和演唱风格。例如: rock, hard rock, alternative rock, clear male vocalist, powerful voice, energetic, electric guitar, bass, drums, anthem, 120 bpm 歌词结构 :使用 [verse] 、 [chorus] 、 [bridge] 等标签来指导歌曲结构。 持续时间 :为获得更稳定的结果,建议从 90-120 秒开始。更长的持续时间(180 秒以上)可能需要生成多个批次。
批量生成 :将 batch_size 设置为 8 或 16,并选择最佳结果——模型可能不一致,因此生成多个样本会有所帮助。
官方代码库版本使用方法:
下载代码:
https://github.com/ace-step/ACE-Step-1.5
首先,使用conda或者miniconda创建python虚拟环境,版本建议是3.11或者3.12.
然后安装UV软件包管理器:
# macOS / Linux
curl -LsSf https://astral.sh/uv/install.sh | sh
# Windows (PowerShell)
powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex" uv run acestep 使用以上命令启动,既可以在:http://localhost:7860/
使用官方的UI。
如果嫌麻烦,那就用comfyui吧,comfyui官方以后会进一步更新支持的。