【干货】关于音频转码,视频音乐提取,音质检测方面的方法个人经验解释说明
暗影哥特-无尽梦魇
2024年08月08日 21:48
新的知识增加了

早前做过有关压制视频编码,转码的一些参数设置说明,有需要的可以去网页链接​了解。今天说明一下音乐歌曲格式转码,压制及音频质量检测辨别,还有视频转音频或视频内音频提取等方面的方法和使用工具。这里主要介绍工具foobar2000(福巴),另外有兴趣的可以自行了解更专业的音频编辑和处理工具Adobe Audition(这里就不说明了)。

foobar2000介绍:

Foobar2000是一款免费的多功能音频播放器,作者是原Winamp开发公司Nullsoft成员 Peter Pawlowski。除了播放之外,它还支持生成媒体库、转换媒体文件编码、提取CD等功能,是一款功能强大的音频处理工具。

官方获取地址www.foobar2000.org(看不懂使用页面翻译),你也可以网页搜索下载其它别人分享整合好的版本,不一定需要最新版,但也不能太旧,保证最基本的功能,组件和解码器正常全面。

若软件不支持拖拽,右键图标属性里面修改安全权限为完全控制,首次安装完可能有些功能不可使用,你需要到官方安装必要的组件和解码器。

打开软件参数选项,选组件选项点击获取更新,等待安装。然后点击获取更多组件,转到官方网页自行选择下载需要的补丁,后回到设置界面点击安装打开组件下载位置选择安装,之后点击应用保存即可。

必装编码器组件包官方页Download点击Free Encoder Pack: encoder binaries for the Converter component转到Download Free Encoder Pack 2024-04-23下载组件,后在本地点击安装(注意安装到foobar2000同目录)

下面介绍一些音频格式:

1.ALAC即Apple lossless audio codec的缩写,是苹果公司开发的一种无损音频格式,苹果在Apache v2.0许可证下开源了“苹果无损音频编解码器(Apple Lossless Audio Codec,缩写ALAC)这种音频格式主要用于Apple生态系统内的设备或程序,例如Apple Music(这就是 Apple Music 歌曲质量出色的原因)。

原本ALAC格式只支持iPhone、iPad、iPod、Mac等苹果设备,不过后来苹果宣布无损音频压缩格式ALAC开源。常见ALAC编码音频文件同AAC编码音频均采用m4a容器封装,需注意查看编码信息可区分它们。同为无损格式但ALAC的压缩率不如FLAC,往往转换后的文件比较大。

2.FLAC无损音频压缩编码(Free Lossless Audio Codec的简称)是一套自由音频压缩编码,其特点是无损压缩。不同于其他有损压缩编码如MP3及AAC,它不会破坏任何原有的音频信息,所以可以还原音乐光盘音质。

FLAC是免费的并且支持大多数平台和设备的基本无损格式,跟APE格式一样是比较常见场用的音频格式。缺点体积大点,优点兼容性好。

3.APE即Monkey's Audio,是一种常见的无损音频压缩编码格式,扩展名为.ape。缩时不会丢失数据,一个压缩为Monkey's Audio的音频文件听起来与原文件完全一样。

APE格式缺点:部分设备和软件不支持,转码和解码速度相比FLAC慢(不过放到现在很多新设备下不是问题),还有就是容错性差,只要在传输过程中出现一点差错,就会让整首APE音乐作废。但最大优点就是比同无损FLAC压缩率高,比如同样歌曲转换后APE格式的文件往往比FLAC小,这就同质量下提升了空间利用率。

4.WAV(WAVE)格式无损音频格式,是微软公司专门为Windows开发的一种标准数字音频文件,该文件能记录各种单声道或立体声的声音信息,并能保证声音不失真。支持多种音频位数、采样频率和声道,采用44.1kHz的采样频率,16位量化位数,WAV的音质与CD相差十分接近。缺点是文件较大,一般是mp3的20倍以上。所以应用率不如APE和FLAC,虽然音质方面更突出,不是对音质特别敏感发烧的人其他人基本辨别不出,也没必要使用。

5.WMA(Windows Media Audio)是微软公司推出的与MP3格式齐名的一种新的音频格式。WMA在压缩比和音质方面都超过了MP3,更是远胜于RA(Real Audio),即使在较低的采样频率下也能产生较好的音质。早前由于设备支持率和普及率不如MP3,所以用的少,另外又不如AAC格式,放到现在就是个二八加九的格式。

6.DSD是Direct Stream Digital的缩写,表示直接比特流数字编码,是SACD(Super Audio CD)的编码模式。它是Sony与Philips在1996年宣布共同发展的高解析数字音响规格。

7.PCM(Pulse-Code Modulation,脉冲编码调制)是最为常见的一种音频编码格式,什么wav,ape,flac,mp3等等几乎所有常见音频都是PCM编码格式。

8.MP3是一种音频压缩技术,其全称是动态影像专家压缩标准音频层面3(Moving Picture Experts Group Audio Layer III),简称为MP3。最常见的有损压缩音频格式,后面升级最高支持比特率320K,压缩率和音质都一般。就是应用普及率高支持设备广,但现在不如AAC格式好。

9.CD—— 标准CD格式也就是44.1K的采样频率,速率1411K/秒,16位量化位数,因为CD音轨可以说是近似无损的,因此它的声音基本上是忠于原声的。

10.OggVorbis(ogg)——是一种新的音频压缩格式,类似于MP3等现有的音乐格式。但有一点不同的是,它是完全免费、开放和没有专利限制的。

11.PCM是在CD和DVD中常用的格式,只不过实际使用的往往是它的衍生版本LPCM。如今使用的大多数PCM文件实际都采用LPCM,因此没必要对他们进行区分。

10.AIFF:1988年由苹果公司为Mac系统开发的,和微软与IBM为Windows开发WAV的目的如出一辙。类似WAV,AIFF也是一种音频容器。后缀是AIFF。 但是,大多数AIFF文件存储的也都是无压缩的PCM格式音频,它也是为Mac系统解码PCM的介质。也正如WAV在Mac上可以无障碍使用一样,Windows上也可以自由使用AIFF格式。

12.ALAC被很多人叫做Apple Lossless。 尽管ALAC很优秀,但它的效率并不如FLAC。但作为苹果公司自己开发的编码,它让苹果用户很难做出其他选择。iTunes和iOS系统都原生支持ALAC格式,但不支持FLAC。

13.AMR——自适应多速率编码,主要用于移动设备的音频存储,在手机端的一些音质存储上用的较多,在低码率下优势明显;当OPUS出来后,AMR其实还是有严重的挑战

14.OPUS——适用于网上上低延迟的即时声音传输, 这种有损压缩算法音质好、效率高、高低码率都可以,现在的WebRtc就用opus这种作为音频传输的重要算法;该算法以48kHz采样为主; 以后新的网络传输音频中,我认为这个会越来越多,因为它很强大,而且现在先进的编码算法效果比AAC都好。

15.AC3——杜比的格式,多通道有优势(全称Audio Coding3音频编码3)是杜比数码的同义词,杜比数码是一种高级音频压缩技术,它最多可以对6个比特率最高为448kbps的单独声道进行编码。1997年初,杜比实验室正式将“杜比AC-3环绕声”改为“杜比数码环绕声”(Dolby Surround Digital),我们常称为Dolby Digital。

E-AC-3全称Enhanced AC-3 bit streams,与AC3类似,但不能后向兼容。AC3的decoder不能解EAC3的bitstream,EAC3的decoder即能解AC3,也能解EAC3。

针对高清电视HD DVDRip的一种音轨,就是Dolby Digital 2.0(杜比2.0),DD+、E-AC-3 、EC3三个说的是同一种格式,由于E-AC-3的音频文件后缀为.ec3,所以也有人成为EC3格式。

下面重点介绍AAC格式:

AAC格式实际上是高级音频编码的缩写。AAC是MPEG-2规范的一部分。AAC所采用的运算法则与MP3的运算法则有所不同,AAC通过结合其他的功能 来提高编码效率。AAC的音频算法在压缩能力上远远超过了以前的一些压缩算法(比如MP3等)。AAC可以在比MP3文件缩小30%的前提下提供更好的音质。ACC的比特率最高512kbps,AAC也是目前最好的压缩音频格式。还有网上有时会碰到ACC格式,这个其实是对AAC的错写导致的。

AAC(Advanced Audio Coding),中文名:高级音频编码,出现于1997年,基于MPEG-2的音频编码技术。由Fraunhofer IIS、杜比实验室、AT&T、Sony等公司共同开发,目的是取代MP3格式。其实AAC的算法在1997年就完成了,当时被称为MPEG-2 AAC,因为还是把它作为MPEG-2(MP2)标准的延伸。但是随着MPEG-4(MP4)音频标准在2000年成型,早前封装容器和后缀名一般为aac,后面新技术算法出现后出现新的M4A封装格式。

这里略带说一下xHE-AAC(exhale)最新一代的AAC系列编解码器,是当今音视频流服务的理想之选,xHE-AAC解码器能够兼容之前所有的版本的AAC编码器,包括AAC-LC、HE-AAC和HE-AACv2。xHE-AAC(Extended HE-AAC)和MPEG-D DRC是最新一代的MPEG AAC编解码器,它改变了语音和音乐内容必须采用不同编码格式的现状。xHE-AAC宽广的传输码率范围能够为所有信号类型(如语音、音乐和混合内容)带来始终如一的高水平音质:单声道低至6 kbit/s,立体声服务低至12 kbit/s,最高达到320kbit/s及以上。它的码率范围涵盖了旧有数据流,令用户能够轻松将其集成到现有编码流程之中。但是目前支持的软硬件设备极少,需要安装特定的解码器,格式虽好但很多地方不能识别。

AAC(Apple)和AAC(Nero)和AAC(Fdk):

AAC(Nero)也就是nero_aac由Nero公司免费发布的音频编码器,支持4种编码模式,最高支持码率为400kbps,一般推荐选用VBR模式转换压缩。

AAC(Apple)也就是qacc编码器,目前运用最广泛也是比较先进的编码器,效果方面也优于其它AAC编码器,最高支持码率为512kbps,这里推荐大家使用这个,编码模式推荐选用CVBR。

图为同一文件的不同编码情况,左图为265kbps的Nero编码,右面为256kbps的Apple编码,从频谱明显可以看出差不多体积和码率编码下Apple效果更佳。

foobar2000有些版本可能无法使用该AAC(Apple)编码,解决方法先到官网foobar2000.org/下载Free Encoder Pack 2020-07-11安装这个(路径与主程序一致)然后下载安装qacc编码器组件(注意:安装前先到foobar本体目录encoders文件夹里删掉qacc.exe这个,后打开压缩包qacc,更具系统位数选择x86(32位)或x64文件内的东西全部复制到encoders文件夹里面),我们用64位的qacc64.exe (不用担心,软件会自动识别)然后点击qacc64.exe或qacc.exe运行即可。最后从新打开foobar2000这个就可以用AAC(Apple)编码了。

AAC(Fdk)是一个高效的AAC编码器,‌以其高质量的音频输出和较低的计算资源占用而闻名。‌它支持多种编码模式,‌包括LC-AAC、‌HE-AAC、‌HE-AAC V2等,‌这使得它在音频编码领域具有很高的竞争力。‌开源软件中,fdk-aac作为MPEG-4和MPEG-2 AAC的解码器,其编码流程复杂而精细,包括滤波器组、TNS、预测、量化、比特流格式和LTP、PNS等步骤。

Fdk编码有时跟Apple难分伯仲,不过foobar中Fdk编码在VBR模式下支持的最高码率为180,所以在192高品音质以下是非常具有优势的,但是该算法的CBR模式就不是很理想(一般不推荐用),另外很多视频编码基本都用fdk-aac编码,其中HE-AAC、‌HE-AAC_V2就是后面新加的SBR增益技术(就是优化调整高频和低频波段及疏密的一种技术手段),该算法主要用于一些元音质较差的低频低码音频,比如HE-AAC用于码率低于85kbps频谱低于13KHZ以下的音频、‌HE-AAC_V2用于码率低于50kbps频谱低于8KHZ以下的音频。

通过个人测试,这三中编码各有优势,不过整体来说Apple的VBR和CVBR模式效果更好,但对于一些元音质较差的低频低码音频用Fdk(VBR)模式有时更好,Nero编码有时对部分纯音乐支持较好,具体哪种好没法确定,你需要通过相同情况下观察频谱来确定,其它的AAC编码器你暂且不需要管。

编码器和解码器的区别应用说明:编码器一般是安插到主程序中转换和编码对应格式音视频的一种算法插件或运行库组件,而解码器则重要是解析和播放对应格式的一种补丁或解析库,二者重要区别就是运用的方向和作用不同。foobar中有些编码格式用不了就说明缺少对应的编解器,自行去网上寻找下载安装。

编码模式说明:

Abr(Average Bitrate)平均码率,是vbr和cbr的折中,给定一个平均码率,每一个区间码率都在平均码率的上下根据质量浮动,相比于纯vbr,可以控制文件大小,相比于cvbr和真vbr编码速度更快,波动程度偏小,略有浮动的波浪线模式。一般用于节奏和旋律较平稳的音频,比如说一些纯音乐等。

Vbr(Variable Bitrate),给定一个质量值,对每一部分音频进行评估,给出对应值得码率。不过文件大小不可控。根据音频情况分配高码和低码,产生更好的质量-空间比,‌属于水平线上下凹凸浮动的波浪线模式,一般用于波动大,高低音转折多,频率幅度明显的音频文件,比如说一些DJ歌曲或电音摇滚等。VBR的缺点在于它不适合网络带宽受限的场景。

Cvbr(Constant Variable Bitrate)可以给定平均值,也可以给定一个范围,可以控制文件大小。也是VBR的一种改进算法,兼顾了CBR和VBR的优点。‌波动程度就类似与vbr,这个波动控制在两条水平线之间,这个模式目前来说比较好调解贴合音频文件,所以选用较多。CVBR的优点在于它能够在保持视频质量的同时,‌更好地适应网络带宽的变化,‌缺点在于其实现相对复杂,‌需要更多的计算资源来处理动态比特率的调整,‌可能会对硬件和编码过程提出更高的要求。

Cbr(Constant Bitrate)恒定比特率,每一帧比特率恒定,最普通的模式,就算是无音的文件也是和正常文件一样大小。比较老旧的模式,比特率算法从头到尾就是一条恒定的水平线,没有起伏变化,音质效果也非常一般,现在基本不怎么用。

4中算法模式ABR和CBR现在基本不用,VBR和CVBR各有其优势和局限性,‌选择哪种编码方式取决于具体的音视频类型及应用情况。其实音频的编码模式跟视频大差不差,一个主要处理图像画面,一个处理声音信息方面。

另外说一下AAC(Apple)编码中的HE-AAC,这个其实是AAC编码后面推出的SBR增益算法功能,一般用于音频质量差(比特率低于84kbps,频谱低于13khz的音频文件)

音频的位深度:

位深度也叫采样位深或位宽,音频的位深度决定动态范围。BPS模式一般有4Bit,8Bit,16Bit,24Bit,32Bit等,位数越高越精细。采样深度可以理解为采集卡处理声音的解析度。这个数值越大,解析度就越高,录制和回放的声音就越真实。一般网上FLAC,APE无损格式(SQ)采用16Bit,一般音质和普通高音质(HQ)采用8bit,更高的WAV音质采用24bit。

音频采样率audio sample rate:

指录音设备在单位时间内对模拟信号采样的多少,采样频率越高,机械波的波形就越真实越自然。在当今的主流采集卡上,采样频率一般共分为11025Hz、22050Hz、24000Hz、44100Hz、48000Hz五个等级,11025Hz能达到AM调幅广播的声音品质,而22050Hz和24000HZ能达到FM调频广播的声音品质,44100Hz则是理论上的CD音质界限,48000Hz则更加精确一些。

在数字音频领域,常用的采样率有:

8,000 Hz - 电话所用采样率, 对于人的说话已经足够

11,025 Hz - 电话所用采样率

22,050 Hz - 无线电广播所用采样率

32,000 Hz - miniDV 数码视频 camcorder、DAT (LP mode)所用采样率

44,100 Hz - 音频 CD, 也常用于 MPEG-1 音频(VCD, SVCD, MP3)所用采样率

47,250 Hz - Nippon Columbia (Denon)开发的世界上第一个商用 PCM 录音机所用采样率

48,000 Hz - miniDV、数字电视、DVD、DAT、电影和专业音频所用的数字声音所用采样率

50,000 Hz - 二十世纪七十年代后期出现的 3M 和 Soundstream 开发的第一款商用数字录音机所用采样率

50,400 Hz - 三菱 X-80 数字录音机所用所用采样率

96,000 或者 192,000 Hz - DVD-Audio、一些 LPCM DVD 音轨、BD-ROM(蓝光盘)音轨、和 HD-DVD (高清晰度 DVD)音轨所用所用采样率

2.8224 MHz - SACD、 索尼 和 飞利浦 联合开发的称为 Direct Stream Digital 的 1 位 sigma-delta modulation 过程所用采样率。

目前市面上大多音视频采用44.1kHz,和48kHz,这个参数转码时一般默认复制原文件本身的即可。

关于音视频详细参数信息查看了解的工具推荐MediaInfo_GUI,这个本人用了好多年了,也是电脑上的必装软件之一,用这个打开音视频就可以查看详细的参数设置,编码信息等各项数据。

声道(Sound Channel) 无特殊情况音视频转码一般默认此项即可。

是指声音在录制或播放时在不同空间位置采集或回放的相互独立的音频信号,所以声道数也就是声音录制时的音源数量或回放时相应的扬声器数量。

声卡所支持的声道数是衡量声卡档次的重要指标之一,从单声道到最新的环绕立体声。

单声道mono:是指一个声音的通道,把来自不同方位的音频信号混合后统一由录音器材把它记录下来,再由一个扬声器进行重放(没有左右声道之分)。早期的收音机都是单声道的,耳机就一个耳朵。

双声道:是指有两个声音的通道,双声道是在空间放置两个互成一定角度的扬声器,每个扬声器单独由一个声道提供信号。双声道是二路输入,二路输出,但不一定是立体声。(左右声道都只有一路的信号输入),也称为双声道混和声。

而立体声Stereo是左右两路分离独立输入,经过立体声编码解码后,左右两路独立输出到双扬声器。立体声是双声道的一种,但双声道不一定是立体声。

立体声的先决条件是立体声编码和解码的过程。达到这一条件的才称的上是真正的立体声了。(关键是立体声编码解码电路,立体声形成的过程)目前大多网络音视频声道数都是2。

区别:

1、性质不同

单声道是指一个声音的通道,用一个传声器拾取声音,用一个扬声器进行放音的过程。

双声道就是指有两个声音的通道。

2、原理不同

单声道是把来自不同方位的音频信号混合后统一由录音器材把它记录下来,再由一只音箱进行重放。

双声道就是实现立体声的原理,在空间放置两个互成一定角度的扬声器,每个扬声器单独由一个声道提供信号。而每个声道的信号在录制的时候就经过了处理:处理的原则就是模仿人耳在自然界听到声音时的生物学原理,表现在电路上基本也就是两个声道信号在相位上有所差别,这样当站到两个扬声器的轴心线相交点上听声音时就可感受到立体声的效果。

3、特点与应用不同

在单声道的音响器材中,只能感受到声音、音乐的前后位置及音色、音量的大小,而不能感受到声音从左到右等横向的移动。所重播时的效果相对于真实的自然声来说,是简单化的,是失真了的。

在电视广播中,单声道伴音质量欠佳,特别是遇到优势的文艺节目,尤其是现场直播高水平的音乐表演时就显得逊色不少。

双声目前最常用途:卡拉OK中,一个是奏乐,一个是歌手的声音。VCD中,一个是普通话配音,一个是粤语配音。

在购买的MTV碟片中,一般都是有两个声道的,即一边为音乐伴音,一边为原唱,可以供唱卡拉OK的人使用,可以通过影碟机的声道转换方便的转化。

多声道Dolby Stereo的定义:

双声道的Hi-Fi系统(高保真系统)与多声道的AV系统(家庭影院系统)是音响器材市场的两大阵营。还有一种7.1声道系统,实际上,7.1声道是在系统中使用一对后环绕扬声器来代替6.1声道的一只后环绕扬声器。6.1声道的影片越来越多,还没有一部7.1声道的影片出现。这是因为这个7.1声道系统并不是一个行业标准,而是一项由某些音响器材公司研发出来的,并将相关技术应用在影院功放上的技术。在7.1声道系统中,Back Surround(后中置)的单声道信号经过矩阵运算,加入延时、回响等多项参数之后,被分配到左后环绕与右后环绕两个声道中,而不是简单地将一路单声道信号平均分配到两个后环绕声道中来。简而言之,这种方案最大的优点就是进一步增强了后部声场的方向感和声像移动的连贯性与真实性。

5.1 声道:即Dolby Digital5.1 和DTS5.1 两种数字多声道环绕声音频格式。它具有左 右两路主声道、中置声道、左右两路环绕声道和一个重低音声道。前面5 个声道都是全频域 声道,重低音声道是一个不完全声道,只发120Hz 以下的低音,称之为0.1 声道,这样便构 成了5.1 声道格式。 6.1 声道:指Dolby DigitalEX 和DTS ES 两种数字多声道环绕声音频格式。它们都是一 种扩展型环绕声音频格式即分别在Dolby Digital5.1 和DTS5.1 的基础上,为了让左右环绕 声衔接得更好而增加一路后中间环绕声道,这便形成了6.1 声道格式。 

7.1 声道:指THX Surround EX 系统。THX 是Lucas 公司对电影院的一种认证标准,不是 音频格式。它严格地制订了电影院相关影音器材与环境的标准,只要符合THX 标准且经过认 证,就能有相当的水准。这样只要消费者选择具有THX 认证的影院,就会有绝佳的影音享受。 后来THX 被移植到家庭影院,用于认证高品质的视听器材,并针对家庭环境的不同有着独特 的要求。例如在5.1 声道系统中,它要求的环绕声是双向发声的侧声道,而非单向发声的后 声道,以达到电影院那种多只扬声器阵列排列的效果。可见 THX 并非Dolby Digital 和DTS 那样为一种音频格式,而是一种音频后处理模式,目的是获得最佳的视听享受。当6.1 声道 的Dolby Digital EX 和DTS ES 出来后,THX 将其进一步演化成THX SurroundEX 系统。为了 兼容原双向发声的侧声道和再度加强环绕声效包围感,于是在原侧声道的基础上又增加了两 只后声道,这就构成了7.1 声道。值得注意的是,THX Surround EX 是将Dolby Digital EX 和DTS ES 的6.1 声道扩展成7.1 声道,并不是一种音频录音格式,它只是将其环绕声效表现更佳而已。

5.1是立体环绕声,7.1是更强大的系统,比5.1多两个声道。7.1声道比5.1声道多一个环绕音响,7.1声道在5.1声道的主音箱与后环绕音箱中间加入环绕音箱。

7.1环绕其实是虚拟的,实际上只有5个音区(左前方环绕、右前方环绕、中置环绕、左后方环绕、右后方环绕)。剩余2个音区(左环绕、右环绕)是从主音区分配来的。

音频比特率也就是音频码率,和视频码率一样,在同一编码格式下数值越高往往音质就越好。

基本的算法是:【码率】(kbps)=【文件大小】(字节)X8/【时间】(秒)/1000。音频文件专用算法:【比特率】(kbps)=【量化采样点】(kHz)×【位深】(bit/采样点)×【声道数量】(一般为2)

一般码率低于80kbps为差音质,普通音质码率大致在92~164kbps左右,HQ高音质192~320kbps左右,SQ无损800~1500kbps左右,CD及其它无压缩音质数值更高甚至比特率数值过万。

音质的辨别方式除了用较专业的工具AU(Adobe Audition)外,这里推荐大家用Spek这个工具,软件小但功能强大且方便,本人一直都用。

下面用工具Spek給大家看一下部分音质频谱对比:

图9:左图AAC右面MP3,都是普通128kbps音质对比

同一音频在几乎相同的码率转换下可以看出AAC的频谱密集度更高,绿色部分更足,右图MP3猛看上去好像频段幅度更大,但细看就会发现频谱很稀疏,放大就会更明显,说明一下决定音质的主要因素在于频谱中的绿色部分,而不是蓝色区域。不过这里AAC是CVBR模式而MP3S是VBR模式,所以比较不太直观。一般128kbps音质正常频谱都在15KHZ偏上,相同码率下AAC音质更好体积更小。

图11:左图AAC(VBR)192kbps右面OPUS(VBR)192kbps

对比发现OPUS效果更好,不过OPUS总是修改采样率48000Hz(不知什么原因额外解码器也修改不过来,可能这是该编码的固有特性吧),而且OPUS编码同样支持最高512的码率,经过本人多次测试压缩48KHZ的音频用该编码效果最佳,不过你的设备和软件的支持情况就是另一回事情了。

左图元WAV右面为转码后的FLAC(VBR)音频

从频谱几乎很难看出哪个效果更好,不过你放大仔细对比的话会发现WAV的密集度更高,但是这种情况对于一般听者来说基本没区别,而且WAV的文件体积大出FLAC和APE格式很多(大概10~20MB左右)。因为正常人耳能识别的频段高出20KHZ时已经听不出了,同理低于0KHZ也是如此,学过初中物理就知道这是人耳听觉上下限,所以一般HQ超高品质(也就是码率256~320kbps,频段18~21KHZ的音频效果基本就够了),所以具体你怎么现在还要考虑各方面因素选折中的方案则为最佳。

左图元WAV右面为转码后的AAC(VBR)音频

像13图这种频谱基本很难分辨出哪个到底是无损音频,所以AAC或OPUS及其它一些先进的有损编码有时有以假乱真的情况,网上很多音频有时很难分辨音质的具体情况,但是一般频谱频段在20KHZ明显一刀切的情况(就算向上还有一些稀疏的蓝色线条)这种不用质疑根本不是无损音质,无损音质一般情况都是呈现20KHZ以上且顶部有起伏密集度较高的频段,但现在随着技术的先进有些音频真的很难辨别真假,不过你也无需太过在意,像图13这种情况就是不是无损它也接近,至少能判断不是普通及一般偏高的音质,反正正常人听不出的,所以我一般不推荐无损格式。

当然不同无损音频之间也是有很大区别的,就拿音乐歌曲来说,风格,响度,场景,新旧,类型等这些因素使得你很多时候无法从听感上分辨好坏,它们之间也不能进行比较,不如同首歌的录音室版和现场版就没有可比性。另外一首歌的音质好坏不在于音效,重要看元音频本身的情况(最初的录音环境,设备,保存方式及采用的格式等),通过一些处理工具其实只是优化虚假的听感,但并不能本质上提升原音频的音质,所以这点大家要搞清楚。

音频频谱中的蓝频和绿频区别:

音频频谱中的蓝屏和绿屏主要指的是频谱分析仪界面上的不同颜色显示,‌用于表示信号的频率和强度。‌

蓝色在频谱图中通常代表较低的频率范围,‌这些颜色用于展示信号中较低频率成分的强度分布。‌蓝色区域通常对应于人耳能够听到的较低频率声音,‌如低音部分。‌

绿色则通常代表较高的频率范围,‌用于显示信号中较高频率成分的强度分布。‌绿色区域通常对应于人耳能够听到的较高频率声音,‌如高音部分。‌也往往是音频主要部分,影响一首歌音质的关键。

一段音频中蓝色部分多还是绿色多其实还跟音频类型,风格,音效等有关,除外可以从Spek这个工具右侧可以看出不同颜色对应的关系,但大多音频中蓝色和绿色部分是主要成分,其它颜色相对占比较少。但决定音质的一般是绿频的多少,高度,密集度等因素。

AAC的一些规格:

MPEG-2 AAC LC低复杂度规格(Low Complexity)

MPEG-2 AAC Main主规格

MPEG-2 AAC SSR可变采样率规格(Scaleable Sample Rate)

MPEG-4 AAC LC低复杂度规格(Low Complexity),现在的手机比较常见的MP4文件中的音频部份就包括了该规格音频文件

MPEG-4 AAC Main主规格

MPEG-4 AAC SSR可变采样率规格(Scaleable Sample Rate)

MPEG-4 AAC LTP长时期预测规格(Long Term Predicition)

MPEG-4 AAC LD低延迟规格(Low Delay)

MPEG-4 AAC HE高效率规格(High Efficiency)

上述的规格中,主规格(Main)包含了除增益控制之外的全部功能,其音质最好,而低复杂度规格(LC)则是比较简单,没有了增益控制,但提高了编码效率,至"SSR"对"LC"规格大体是相同,但是多了增益的控制功能,另外,MPEG-4 AAC/LTP/LD/HE,都是用在低比特率下编码,特别是"HE"是有Nero AAC编码器支持,是近来常用的一种编码器,不过通常来说,Main规格和LC规格的音质相差不大,因此目前使用最多的AAC规格多数是"LC"规格,因为要考虑手机目前的存储器能力未达合理水平。 MPEG-4 AAC LC(Low Complexity)是最常用的规格,我们叫"低复杂度规格",我们简称"LC-AAC",这种规格在中等码率的编码效率以及音质方面,都能找到平衡点。所谓中等码率,就是指:96kbps-192kbps之间的码率。因此,如果要使用LC-AAC规格,请尽可能把码率控制在之前说的那个区间内。在这个区间内,LC-AAC可以完全打败同码率的用LAME最高质量慢速编码模式的MP3。

下面大概说一下foobar2000工具的一些使用功能介绍:

拖拽或点击右上方文件打开目录下的音频或视频就可以添加到界面然后可播放或转码操作

选择对应文件右键打开属性就可以查看音视频的基本参数信息,也可以在这添加或删除歌曲中的内嵌封面,添加封面建议选择像素500*500大小不超过80KB的JPG或JPEG格式图片,不过注意有些音频格式不支持内嵌图片。

图片像素一般不代表图片的分辨率(很多时候指图片大小尺寸)而决定图片质量画质的重要是像素密度,分辨率往往是对应的场宽和框架,像素度和分辨率搭配的好呈现的图片效果就更佳。不过图片原本的质量跟你所使用的设备和保存方式及选用的格式有关,一般BMP和PNG格式属于无损储存,而且PNG还可以保存透明度(这个一般抠图做底片或某种贴图素材中用),其它情况用JPG或JPEG这种有损体积小的格式就行,另外像GIF这种就是针对动图的,另外一些其它格式就不详细说了,毕竟不是这期重点。

目标输出样式区别解释:

转换每个音轨为单独的文件和转换包含多音轨的文件的主要区别在于文件的组成和结构。‌

转换每个音轨为单独的文件:‌这种做法通常是将原始的多音轨文件(‌如一个专辑或电影的音轨)‌分割成单独的音轨文件,‌每个文件只包含一个独立的音频流。‌这样做的好处是每个音轨文件可以独立播放,‌方便管理和选择特定的音轨进行播放。‌例如,‌在制作DTS CD时,‌需要将DTS编码的音轨信号分割成单独的文件,‌因为DTS CD中记录的实际内容并不是普通CD的PCM采样信号,‌而是DTS编码的音轨信号1。‌此外,‌无损音乐的分轨处理也可以将一个包含整张专辑的歌曲分割成单曲,‌这样方便用户选择想要听的歌曲,‌而不会因为文件数量过多而导致转存时遗漏某个歌曲2。‌

转换包含多音轨的文件:‌这种做法是将多个音轨合并到一个文件中,‌通常这个文件会包含多个音频流,‌每个音频流代表一个不同的音轨。‌这种文件通常用于保存整个专辑或电影的声音效果,‌因为它保留了原始的多音轨信息。‌例如,‌在制作DTS格式的WAV文件时,‌需要将多轨文件中的音轨提取为单独音轨文件,‌然后再将这些单独的音轨文件合并成一个包含多音轨的WAV格式文件。‌

合并所有音轨为一个输出文件:在Logic Pro等专业的音频处理软件中,‌可以将多个音轨合并为一个单一的音频文件。‌这通常涉及到将多个音轨渲染或并轨到一个输出文件中,‌可以选择实时或离线方式进行。‌

总的来说,‌将每个音轨转换为单独的文件更适合于需要独立播放或管理特定音轨的情况,‌而将多个音轨合并到一个文件中则更适合于保留原始的多音轨信息,‌如整个专辑或电影的声音效果。‌

额外解码器:

启用解码器后置处理-用于解码DTS,HDCD等(该选项若你没有安装对应插件的话选不选都一样),通常涉及到安装和配置相应的插件。‌对于DTS解码,‌foobar2000需要安装一个名为foo_dts.dll的DTS解码器插件,对于HDCD(‌High Definition Compatible Digital)‌解码,‌foobar2000可能不直接支持HDCD解码,‌因为HDCD是一种特殊的音频编码技术,‌需要专门的硬件或软件支持。‌然而,‌有些用户可能通过安装额外的插件或软件来间接实现HDCD解码,‌但这通常不是foobar2000内置的功能。‌请注意,‌foobar2000的插件和设置可能会随着软件版本的更新而发生变化。‌因此,‌建议查阅foobar2000的官方文档或社区论坛以获取最新的信息和指导。‌另外,‌如果你遇到任何与foobar2000或其插件相关的问题,‌可以尝试在foobar2000的官方论坛或社区中寻求帮助。‌那里的用户和开发者可能会提供有用的建议和解决方案。‌

①Convolver解码器是一种音频处理工具,‌用于对音频信号进行卷积处理。‌ 这种处理可以模拟不同的音响环境或添加特定的音效,‌从而改变音频的听觉体验。‌Convolver解码器通过应用卷积算法,‌将预先设计好的“冲激响应”应用到音频信号上,‌实现各种音效的模拟。‌这种技术可以用于模拟不同的音响环境,‌如混响、‌回声、‌空间感等,‌使得音频听起来更加立体和逼真。‌

在Foobar2000中,‌Convolver解码器作为一个插件或组件,‌可以与其他组件一起使用,‌提供更丰富的音频处理功能。‌通过使用Convolver解码器,‌用户可以自定义音频的听觉效果,‌实现个性化的音乐体验。‌这种解码器特别适用于需要精细调整音效的音乐制作、‌录音和后期处理等领域。该功能自行测试使用,一般情况不用。

②DVD-Audio水印检测器,用于检测DVD-Audio格式音频中的水印信息,专门用于处理和分析DVD-Audio格式的音频文件。‌这个功能允许用户启用DVD-Audio水印检测器,‌从而在播放DVD-Audio音频时,‌能够检测并显示音频中的水印信息。‌水印信息通常用于版权保护、‌内容认证或其他特定的应用场景。‌一般这个功能不用管。

③反转立体声声道,允许用户调整左右声道的音频信号,‌使其在播放时左右声道互换,‌从而改变声音的定位和听觉体验。‌根据情况而定,一般用不到。

④高级限幅器主要用于防止音频信号超过规定的上限,‌避免音频失真。‌是一种音频处理工具,‌其主要作用是限制音频信号中的最高峰值,‌确保这些峰值不会超过设定的上限,‌从而防止音频失真或削波。‌通过调整限幅器的阈值,‌可以控制哪些部分的音频信号被允许通过,‌哪些部分则被限制或压缩,‌以保持音频的质量。‌在Foobar2000中,‌高级限幅器的设置允许用户对音频信号进行更精细的控制,‌以达到最佳的听音体验。‌此外,‌长时间使用耳机听歌时,‌开启高级限幅器还可以减轻听力疲劳。‌对于处理一些噪杂音频振幅高的声音文件,用不用具体情况具体对待。

⑤降混声道为单声道,主要作用是简化音频信号,‌使其更容易被处理和播放。‌在Foobar2000中,‌将声道降混为单声道是一种处理方式,‌它可以将原本立体声音频信号转换为单声道信号。‌这种转换有助于简化音频信号,‌使得在播放或处理音频时更加便捷。‌单声道信号相对于立体声信号,‌其信息量减少,‌但同时也意味着对音频设备的依赖降低,‌因为单声道信号不需要立体声系统中的左右声道分离来呈现。‌

⑥将声道降混为单声道在特定情况下非常有用,‌例如:‌

⑦简化音频处理:‌在音频编辑、‌转换或传输过程中,‌单声道信号更容易被处理,‌因为不需要考虑立体声的复杂性和兼容性问题。‌

兼容性:‌某些较旧的音频设备可能不支持立体声,‌将音频降混为单声道可以确保这些设备能够正常播放音频。‌

⑧减少资源占用:‌在播放或处理大量音频文件时,‌单声道文件通常会比立体声文件占用更少的系统资源,‌这对于资源有限的系统来说尤为重要。‌

⑨交错渐变器(‌Crossfader)可以实现音乐淡入淡出效果。‌它允许用户调整音乐的播放方式,‌实现音乐从无到有或者从有到无的平滑过渡,‌即淡入淡出效果。‌这个功能对于提升听音乐的体验非常有帮助,‌因为它可以使音乐播放更加自然,‌减少突然开始或结束时的不适感。‌用户可以根据自己的喜好调整交错渐变器的设置,‌比如增加或减少淡入淡出的时间长度,‌以达到最佳的听觉效果。‌此外,‌交错渐变器的设置非常灵活,‌用户可以单独开启或关闭,‌并且可以进行细微的调整,‌以满足不同的听觉需求。‌

均衡器可以用来调整音乐的频率分布,‌从而改善音质和听觉体验。‌均衡器通过调整不同频率的音量,‌可以显著影响音乐的听感。‌例如,‌提升8000-12000Hz的频率可以增强音乐的高频表现,‌使声音更加明亮和清晰。‌然而,‌这个频段的音量不宜过多,‌否则可能会导致女声的齿音过重。‌另一方面,‌适当调整低频段的频率,‌如80-160Hz,‌可以影响音乐的厚实感,‌如果这部分表现得好,‌即使80Hz以下的频率缺乏,‌也不会让人感到低音不足。‌这个功能跟剪辑软件中一样,具体你要自行测试使用。

⑩Foobar2000中的上混为5.1和7.1声道的主要作用是在听众的四周打造一套均衡的声场,‌提供更为立体和环绕的听觉体验。‌5.1声道:‌这是一种更为立体的环绕声系统,‌相比2.0立体声系统,‌5.1声道增加了后方的声道,‌提供了更加宽广的音响范围和更深的环绕感,‌使得听众能够感受到更加真实的音频场景。‌

7.1声道:‌则是在5.1声道的基础上进一步升级,‌增加了更多的声道,‌通常包括两个额外的侧声道,‌使得音响系统更加复杂和立体。‌7.1声道系统的核心作用在于在听众的四周打造一套均衡的声场,‌相比5.1声道,‌7.1声道增加了后中声场声道,‌提供了更加细致和全面的音响体验。‌

⑪跳过静音区域,你可以调解长度和响度来去除音视频中的空白部分或不太明显的声音频段,具体要针对音频文件测试设置。

⑫移动立体声为后置声道,这种设置通常用于模拟环绕声音效,‌以提供更加沉浸式的听觉体验。‌一般情况用不到。

⑬硬-6DB限幅器,主要用于调频信号,‌一定程度上去除杂波干扰,‌避免破音影响音质。‌在无论原声道如何的情况下,‌统一将音量限制为-6dB。‌这种设置常用于多声道转换立体声时开启,‌以改善音质。‌一定程度上减少音频信号中的杂波和干扰,‌从而使音频播放更加纯净,‌减少破音现象,‌提升听觉体验。‌建议根据个人听觉偏好和音频源的质量适当调整设置,‌以达到最佳的音质效果。‌同时,‌结合其他DSP效果器如高级限幅器等,‌可以进一步优化音频播放的质量。

⑭重采样器SSRC和PPHS主要用于调整音频信号的采样率,‌以适应不同的播放设备和优化音质。‌若你需要升高或降低采样率就可以用该功能(部分格式不适用),但一般情况不用。

SSRC重采样器:‌SSRC重采样器在音频处理中表现出色,‌尤其在整数倍升频时,‌其性能略优于SOX重采样器,‌尽管这种差异非常小。‌用户使用SSRC重采样器的主要原因是它提供了更高的目标频率,‌这有助于在特定的系统中实现更好的音频播放效果。‌例如,‌通过将所有PCM信号升频到705.6KHz,‌然后再变换为2.8MHz的DSD64信号,‌SSRC重采样器帮助用户在一个相对廉价的DAC上实现了高质量的音频输出。‌

PPHS重采样器:‌PPHS重采样器在音频处理中也扮演着重要角色,‌尽管它在某些情况下可能不如SSRC表现优秀。‌PPHS重采样器的具体优势和适用场景可能因不同的使用环境和需求而异,‌但它同样是为了优化音频信号,‌使其更好地适应播放设备,‌从而提升音质和听觉体验。‌

在foobar2000中,SSRC重采样器在整数倍升频时略好,但差别非常小,如果你主要关注整数倍升频的情况,SSRC可能是更好的选择。

⑮转单声道为立体声,转立体声为4声道,转换声道为立体声。这些声道转换的作用主要体现在改善音频的听觉体验,‌使声音更加丰富和立体。‌

单声道转立体声:‌单声道音频只有一个声道,‌缺乏立体感,‌听起来比较平淡。‌通过转换为立体声,‌可以让声音具有左右两个声道,‌模拟出更宽广的音场,‌提供更加立体和逼真的听觉体验。‌

立体声转4声道:‌立体声虽然已经比单声道更加立体,‌但通过转换为4声道(‌如4.0或4.1声道)‌,‌可以进一步增加声音的环绕感和深度,‌让听众感受到来自多个方向的声音,‌仿佛身临其境,‌提供更加沉浸式的听觉享受。‌

这种声道转换功能对于音乐发烧友和电影爱好者来说非常有用,‌因为它可以让用户根据自己的需求调整音频的声道配置,‌以达到最佳的听觉效果。‌例如,‌在进行音乐欣赏或观看支持多声道的电影时,‌通过foobar2000进行声道转换,‌可以显著提升音频的质量和观影体验

播放增益是多媒体软件的一种功能,‌可以将播放内容保存到音轨里面。‌ 在foobar2000这款高级音频播放器中,‌播放增益的功能允许用户调整音轨的增益值,‌以改善音频的音量和音质。‌具体来说,‌用户可以通过foobar2000的设置菜单,‌双击“工具”选项中的“播放增益扫描器”,‌然后通过调整“目标音量级别”下的滑块来更改音轨增益值。‌这一功能对于那些音量不一致或音质需要调整的音频文件特别有用,‌可以帮助用户统一音频文件的音量,‌使其听起来更加均衡和一致。‌

不重置音轨之间的DSP-慢,需要交叉渐变等(该项一般不用勾选),DSP选项是Advanced Limiter(高级限幅器),Crossfader(交叉渐变器),若你采用了已激活中的对应处理器,就不要选用下面这个,不过没有特殊要求或不是很懂就不要勾选这个。

以上这些额外功能若不是太懂就不要选用,一般对普通音乐歌曲转码往往用不到这些功能,若你对音频音质和效果很敏感在乎就自行尝试选用。多数情况这些辅助功能用不到,因为这些并不会本质上提升音质,只是改变你的听感效果,就跟图片画面和视频画质修复一样,是一种虚假的观感和听感,所以不用太纠结用这些功能。

其它:

生成简短的预览,就是不完全转出整个音频,而是根据你所选的百分比和时长导出部分预览。此项不勾选

显示完整的状态报告,一般没必要,所以不选。

扫描输出文件的播放增益,这个就是你对当前转码音频播放时运用的增益效果,默认不选,具体看个人引用情况。

转移元数据(标签),就是转码后保留原来音频中的基础信息,默认选择。

转移内嵌图像,转换时一并导出音频中镶嵌的专辑图片,选不选自行决定。

转换中止或失败时保留转换文件,就是转码中出现错误失败不完整的欠缺文件。增项选不选要看你自身需求情况决定,默认是不选的。

下面再給大家推荐一款本人一直在用的音视频解码播放器K-Lite Codec Pack,基本市面上的所有音视频格式都能识别解码播放,而且效果也非常好(播放时基本能完全发挥你电脑的最佳效果),本人必装软件之一。

基本介绍:K-Lite Codec Pack是一个免费的组件包,用于在Direct Show播放器中播放音频和视频,例如Windows Media Player、Media Center等。它可以提供所有音乐和视频文件的高质量播放,包括MKV、MP4、AVI、FLV等。具有易于使用的界面但灵活的选项,可以享受无问题的多媒体播放。

当然大家也可以用视频转码软件(如:格式工厂,ShanaEncoder等工具转码和提取音频,效果就看软件功能方面的情况),也可以用音视频剪辑软件(如:快剪辑,万兴喵影,Movavi Video Editor等达到目的,这类软件的好处就是提供较多音效且方便试测,和可以裁剪制作铃声,不过缺点就是导出时参数设置一般较为简单或固定死板不适配,导致输出的音频文件质量和效果不稳定),不过你要是不怎么在乎音视频质量效果的话也可以选择更简单的工具,比如一些音视频播放器内部自带的音视频转换或剪切功能,又或者使用手机上的一些应用APP(如:剪映,必剪,一些免费的音频转换软件,铃声制作软件或部分APP内所含的小型插件等)又或者寻找直接提供简单转换的网址也行,不过这些往往功能简陋单一,加上手机本身限制很多参数信息不明,所以弄出的音频质量效果就不好掌握。还有一种简单粗暴的视频转音频方式就是直接改后缀名,这样做音频音质和体积就是视频的音质和大小,但是你的硬件和软件程序识不识别就是另一回事了。

另外说一下LRC和KSC歌词格式文件,一般网上大多音乐软件采用的格式为LRC(简单,便携,体积小),KSC格式一般用于视频MV中的字幕或卡拉OK视频中,在歌曲和字幕对应精度方面更加准确精细,而且可以在MV视频中呈现各种样式。说了两种歌词形式各有优势,区别在于运用场景,用途,场合等不同形势方面。

申明:以上内容由本人查阅网络和个人经验总结,其图片来源于个人截屏,由本人整理而成。若有什么遗漏和不足之处含望各位在评论区补充和纠正。