做了2个咕嘎的小视频,感觉到AI处理的复杂和多样性,觉得不应该自己一个人造车了,希望和大家多交流。
目前视频上面的点子倒不是很多,就小结下之前做的时候出现的情况,供分享。
咕嘎的三维图有大佬分享过,用起来AI的视频里面基本上不会出现脸崩的情况,这很完美;但是吧,总会加些额外的表情,当然不是说不行,有时候也会有惊喜,但是也太随机了。
我做的第二个的设想是让咕嘎翻唱一句歌词,然后词都变成“咕嘎”这样的拟声词,没想到就会撞到一堵名为音频的墙。这个墙如此之高,以至于我去翻以前大佬的视频才发现很少是有配音的2333。
解决音频的时候才发现原先里面偶尔出现的"咕嘎"的配音并不知道是哪种音源,去几种剪辑软件翻了几天最终放弃了,而且音频的剪辑也是另外一道墙,涉及到词的修改又是一道墙,豆包推荐了很多音源修改软件,然而免费的毕竟本来就少,很多提供的功能只能写一个词让它念/朗读,或者翻唱,但是又不能同时改词,总之就是功能比较单一,最终是在xstudio里面出现了一种功能是提取音频的音阶,音阶下面同时显示了这一段的歌词,并且可以编辑,才最终实现改词翻唱的功能。
目前重心在学习mcp开发框架,写一些自用的小程序,欢迎讨论