← 返回信息流
AI 资讯Hacker News·19 小时前

SoundCloud音频界面改版,极简设计上线

原标题:Less Is More: Why Audio on SoundCloud Looks Different

速览

SoundCloud近日对音频播放界面进行了改版,采用'少即是多'的设计理念,简化了视觉元素。用户将看到更清爽的波形图和操作按钮,减少干扰。此举旨在提升聆听体验,让内容本身更突出。

AI 深度解读

背景

去年,SoundCloud 对其 AAC 编码器进行了十多年来的首次升级。新编码器采用了 Fraunhofer 的 libfdk_aac,在各项指标上都带来了更高的感知音频质量。然而,如果你观察频谱图,可能会发现一些意料之外的现象:上传无损母带后,从 SoundCloud 下载的音频在频谱分析仪中显示,17 kHz 以上出现了一个陡峭的截断,而原本这些频率能量可以一直延伸到 20 kHz。旧编码器保留了这些高频,新编码器却将它们去掉了。这看起来像是一次降级,但实际上恰恰相反。

核心内容

无损文件(如 WAV、FLAC)会保留每一个采样点,输入什么输出什么,逐位还原,不做任何取舍或妥协。而有损压缩(如 AAC、MP3、Ogg)则完全不同——编码器必须丢弃一些信息,以达到目标文件大小。问题不在于是否会丢失信息(一定会丢失),而在于编码器选择丢弃哪些信息。

当 SoundCloud 将你的上传文件压缩为 AAC 时,编码器会为每一段音频分配固定数量的比特。这些比特被分配到各个频段上。每个频段获得的比特越多,还原就越精确;比特越少,失真就越大。比特总数永远不够覆盖所有内容,因此编码器必须决定将比特花在哪些地方。

随着比特率下降,量化后的信号会逐渐偏离原始频率分布。但如果将低通滤波器向左调节(即降低截止频率),有趣的事情发生了:编码器放弃了高频顶端,而其他所有频段都变得更加清晰。这就是取舍:放弃你几乎听不到的内容,让你能听到的部分获得更干净的信号。

人耳的听觉灵敏度并不平坦。在 2 kHz 到 5 kHz 之间,我们的听觉最敏感;在高频区域,灵敏度显著下降。大多数成年人即使在理想聆听条件下也无法可靠地感知 17 kHz 以上的音调。因此,最高频段成为比特率优化中最具效率的牺牲对象——频谱顶端的一小部分减少,就能让编码器在更广阔的听觉范围内提升准确性。

虽然频谱图对不同频率一视同仁,但我们的耳朵并非如此。编码器的设计围绕人的听觉方式,而非图形的外观。编码器在成本最低的地方进行削减。你可能会问,为什么不削减低频?低频编码所需的比特很少,而且你既听到它们也能感受到它们。相比之下,频谱顶端是最廉价的牺牲品。

下面是一首流行混音通过旧编码器和新编码器处理后的对比图。这张图显示了编码音频与原始音频之间的差异:红色表示能量被去除,蓝色表示编码器添加了原本不存在的内容(伪影)。新编码器(右图)做出了一次明确的牺牲——顶端的一条红色带,表示它有意切除了高频。在这个区域之下,几乎没有任何差异。而旧编码器(左图)则完全不同:中高频区域散布着红色斑点(在你听得最清晰的频段中丢失了信号),低频区域有蓝色斑块(编码器引入的伪影)。旧编码器在整个频谱上都在挣扎。

同样的结果以柱状图呈现:对比同一个编码器在开启和关闭低通滤波器时的表现。当滤波器关闭(红色)时,中频段的误差率更高——正好是你的耳朵最敏感的区域。当滤波器开启(蓝色)时,这些频段获得了更多比特,误差随之下降。滤波器确实在发挥它的作用:用难以察觉的高频顶端换取更干净的中频。

有人可能会问:在 256 kbps 比特率下,带宽已经几乎足够,为什么还要做低通滤波?确实,256 kbps 下比特数接近充足,你可能期望全带宽工作正常——而且几乎确实如此。但“几乎”仍然意味着编码器在复杂段落中需要在中频段做出艰难抉择。我们使用的编码器(libfdk_aac,Fraunhofer 实现)是保守的:即使在 256 kbps 下,它也会在 17 kHz 附近施加一个缓和的滚降。相比更低比特率,改善幅度较小,但仍然可测量。在 256 kbps 下这样做是否合理?这确实值得商榷,但并非随意为之。Fraunhofer 通过数十年的广泛聆听测试验证了这些截止点。阈值的存在是因为训练有素的听者无法可靠地区分差异,而释放出的比特让其余信号变得可测量地更好。

我们可以展示大量的图表,但这里提供一个盲测:三段相同的音频——原始无损音频,以及两个 256 kbps 编码版本(一个开启低通滤波器,一个关闭)。你能分辨出哪个是哪个吗?哪个版本应用了低通滤波器?你的音频并没有损坏,它听起来比看起来更好。

关键要点

  • SoundCloud 新编码器(Fraunhofer libfdk_aac)在 17 kHz 处施加了低通滤波器,看似降低了高频带宽,但实质上是将节省的比特重新分配给中频段(人耳最敏感的区域),从而显著提升整体感知质量。
  • 有损压缩的核心理念不是“保留所有信息”(不可能),而是“有策略地丢弃信息”。编码器牺牲人耳最不敏感的高频,换取可听范围内更低的失真。
  • 人耳对 2 kHz–5 kHz 最敏感,对 17 kHz 以上几乎无法感知(尤其成年人)。这是高频成为最优牺牲对象的生理学基础。
  • 对比新旧编码器:旧编码器在整个频谱上出现分散的信号丢失和伪影(尤其在中高频),而新编码器仅在顶端有明确的切除,以下区域几乎无误差。
  • 即使在 256 kbps 这样相对较高的比特率下,新编码器仍采用温和的低通滤波,因为“几乎无误差”仍会在复杂段落中迫使中频做出妥协,而滤波后的可测量改进已经过 Fraunhofer 数十年聆听测试验证。
  • 盲测表明,普通听众很可能无法区分开启低通滤波与未开启的 256 kbps 版本,而滤波版本在听觉上可能更干净。

意义与影响

SoundCloud 此次编码器升级揭示了音频质量评估中一个常见的认知误区:频谱图上的“完整性”并不等同于听觉上的“保真度”。许多用户和音乐制作人习惯用频谱分析仪测量音频,认为高频延伸到 20 kHz 就是高质量,但这一指标忽略了人耳的实际感知特性。新技术表明,编码器应以人类听觉系统为导向,而非以视觉化的折线图为标准。

这一做法对音频流媒体行业具有启示意义:在带宽和存储成本受限的背景下,更聪明的比特分配策略可以带来感知质量的大幅提升,而不必追求“无损”的频谱外观。Fraunhofer 的保守设计(即使在 256 kbps 也保留低通滤波)体现了工程上的权衡智慧——在极端条件下,宁可牺牲一个几乎不可闻的区域,也要确保核心听感区域的纯净。

对于音乐制作人和发烧友而言,这意味着不应仅凭频谱图来判断音频质量;应相信经过科学验证的编码算法,以及经过盲测验证的听觉结果。SoundCloud 的升级案例也提醒行业,时隔十年才更新编码器,说明音频编码技术的进步并非总是显而易见的,但每一次细微的优化都可能带来实际听感上的显著改善。

查看原文 →developers.soundcloud.com