01声音本来是什么?

我们听到的声音,本来不是数字。 它来自物体振动,并让周围空气产生不断变化的压力。

这些压力变化会向四周传播,形成声波。 我们的耳朵接收到声波,就会产生听觉。

物体振动

例如琴弦、人的声带

空气压力变化

形成连续变化的声波

耳朵听见

把声波变成听觉

02麦克风先做了什么?

麦克风的任务不是“直接把声音变成 0 和 1”。 它通常会先把空气振动转换成一个连续变化的电信号

声波

空气压力不断变化

麦克风

把声波转换成电信号

模拟电信号

仍然是连续变化的

03什么叫“采样”?

模拟声音信号是连续变化的。 数字系统不能无限细地记录每一个瞬间,所以会按照固定时间间隔去“看一眼”当前信号有多高。

这个过程叫作采样(Sampling)

连续信号

在固定时间点取样

04一秒钟要采多少次?

一秒钟采样多少次,叫作采样率(Sample Rate)。 单位通常是 Hz(赫兹)。

8 kHz

每秒 8,000 次

语音通信中曾很常见

44.1 kHz

每秒 44,100 次

CD 音频使用的标准采样率

48 kHz

每秒 48,000 次

视频、影视和数字音频中很常见

采样率越高,理论上能记录的最高频率范围也越高。 按采样理论,要想可靠表示最高频率为 f 的信号, 采样率必须高于 2f,而且实际系统还需要留出滤波余量。

05连续的高低怎样变成整数?

采样只解决了“什么时候记录”。 但每次测到的信号强度本来仍然可以是连续值。

数字系统还要把它映射到有限个可以表示的等级, 这个过程叫作量化(Quantization)

真实采样值 ≈ 6.7

连续信号可能落在任意位置

量化到最近等级 7

变成可记录的离散数值

等级 7 等级 6 等级 5 等级 4 等级 3 等级 2 等级 1 等级 0

06位深越大意味着什么?

每个采样值用多少 Bit 来保存,叫作位深(Bit Depth)

8 Bit 2⁸ = 256

256 个可能的数字等级

16 Bit 2¹⁶ = 65,536

可以表示更多等级

24 Bit 2²⁴

常见于专业录音与音频制作

位深越高,量化可以分得越细, 通常意味着更大的动态范围和更低的量化噪声。

07数字声音保存下来以后是什么?

完成采样和量化以后, 声音就可以表示成一串按时间排列的数字。

1032 2875 4201 3980 2102 850

一串采样值

这些数字按照时间顺序排列,就能描述声音波形

这种直接记录采样值的思想常见于 PCM(Pulse-Code Modulation,脉冲编码调制)

PCM / WAV

可以保存未压缩或近似原始的 PCM 音频数据

FLAC

无损压缩,解码后可以恢复原始音频数据

MP3 / AAC

常用有损压缩,舍弃部分不重要的信息来减小文件

08播放时又怎样变回声音?

播放数字音频时,过程大致反过来: 程序读取音频数据,再把数字采样值转换成连续电信号,最后驱动扬声器振动。

1

读取音频数据

必要时先解码

2

DAC 转换

把数字信号变成模拟电信号

3

扬声器振动

产生空气压力变化

4

我们听见声音

重新回到真实世界的声波

你已经知道了什么

  • 声音本来是空气中连续变化的压力波,不是数字。
  • 麦克风通常先把声波转换成连续变化的模拟电信号。
  • ADC 通过采样和量化,把模拟信号转换成数字数据。
  • 采样率表示每秒采样多少次,例如 44.1 kHz 表示每秒 44,100 次。
  • 量化把连续的信号幅度映射成有限个数字等级,因此会产生量化误差。
  • 位深决定每个采样值能使用多少个等级;常见有 16 Bit、24 Bit 等。
  • PCM 可以直接记录按时间排列的采样值,FLAC、MP3、AAC 等格式会进一步编码或压缩。
  • 播放时,DAC 会把数字数据转换回模拟电信号,再由扬声器产生声波。

下一个问题: 图片和声音都能变成数字, 那为什么照片和视频常常特别占存储空间? 下一篇:为什么照片和视频那么占空间?