電腦裡的音樂,從硬碟到耳朵之間要走過一條不算短的鏈路: 檔案 → 解碼 → 混音 → DAC → 放大 → 耳機。 規格表上寫著 24-bit/96 kHz、訊噪比、阻抗、靈敏度,但這些數字到底在管什麼? 為什麼同一副耳機插手機很小聲、插耳擴卻生龍活虎? 本文把數位音訊與音效電路的教材,改寫成不須電子背景也能看懂的版本。
聲音是空氣的壓力變化,但硬碟裡沒有空氣,只有 0 與 1。 所以電腦播音樂,本質上是「把數字還原成空氣振動」的工作,中間得經過好幾關。
PCM,也可能是壓縮過的格式。壓縮又分「無損」與「有損」兩種。一句話記住: 數位這一段負責把資料搬得一字不差,類比這一段負責把電壓變得夠乾淨、夠有力。 兩段的問題完全不同,卻常被混為一談。
很多人以為「數位」是比較高級的訊號,其實它只是一種約定好的表示法, 最大優點是可以完美複製:只要還分得出 0 與 1,抄一萬次也不會失真。 但它本身推不動任何東西——您沒辦法用一串 0 與 1 去推動振膜。
耳機的發聲原理,是把變化的電流通過線圈,線圈在磁場中受力,帶動振膜前後移動—— 連續變化的電壓才能產生連續變化的聲音。 所以「數位最後一定要變成類比」,不是因為類比比較好聽,而是因為物理世界只接受類比。
ADC(類比數位轉換器)做的是相反的事:麥克風收到微弱的類比電壓, 先放大、濾掉高頻,再取樣與量化成數字。它常被忽略,卻決定了錄音、通話、 直播的品質。很多人被說「麥克風很吵」,問題其實出在 ADC 前端的放大與雜訊。
| 訊號形式 | 優點 | 缺點 | 出現位置 |
|---|---|---|---|
| 數位 | 可完美複製、不怕雜訊累積 | 無法直接驅動物理裝置 | 檔案、解碼、混音 |
| 類比 | 可直接驅動耳機與喇叭 | 每段電路都會累積雜訊與失真,無法還原 | DAC 之後的放大與振膜 |
這個差別很重要: 數位檔案不會「聽久了變差」,複製一萬次也一樣。 會變差的永遠是類比那一段:接點氧化、屏蔽不良、放大器底噪、振膜老化。
把連續的聲音變成數字,要做兩件事:在時間軸上每隔一小段量一次, 以及把量到的電壓記錄成有限精度的數字。前者叫取樣率, 後者叫位元深度。
取樣率的單位是 Hz,指「每秒量幾次」。這裡有一條不能違背的定理:
奈奎斯特定理——取樣率為 fs 時,能正確記錄的最高頻率是
fs / 2,稱為奈奎斯特頻率。
超過它的訊號不但錄不到,還會摺疊回來變成不存在的低頻假訊號,
這個現象叫混疊(Aliasing)。
| 取樣率 | 奈奎斯特頻率 | 常見用途 | 相對 CD 資料量 |
|---|---|---|---|
| 44.1 kHz | 22.05 kHz | CD 與消費音樂的歷史標準 | 1 倍 |
| 48 kHz | 24 kHz | 影片、遊戲、系統預設 | 1.09 倍 |
| 88.2 kHz | 44.1 kHz | 44.1 kHz 的整數倍 | 2 倍 |
| 96 kHz | 48 kHz | 錄音與後製 | 2.18 倍 |
為什麼是 44.1 kHz 這個奇怪的數字?因為早期數位錄音是把音訊塞進錄影帶的 空白區傳送,容量算下來剛好是這個值;48 kHz 則是為了與影像時間碼對齊。 兩者都沒有玄學,純粹是歷史與工程的產物。
位元深度決定每個取樣點能記錄幾種電壓準位:n 位元可表示
2ⁿ 個階層。階層越多,「最大聲」與「最小聲」的差距就越大,
這個差距稱為動態範圍。關鍵換算是:
每多 1 個位元,動態範圍約多 6 dB。
| 位元深度 | 階層數 | 理論動態範圍 | 意義 |
|---|---|---|---|
| 8 bit | 256 | 約 48 dB | 電話語音等級,明顯嘶嘶聲 |
| 16 bit | 65,536 | 約 96 dB | CD 標準,一般聆聽充足 |
| 20 bit | 1,048,576 | 約 120 dB | 專業錄音中繼格式 |
| 24 bit | 16,777,216 | 約 144 dB | 錄音後製標準,數位音量更有餘裕 |
值得記住的兩個數字: 16 bit 的動態範圍約 96 dB,24 bit 約 144 dB。 而人類在安靜房間裡的可聽動態範圍大約 70 到 90 dB—— 這正是「16 bit 夠用」的關鍵。
先講結論:只要取樣率足以完整記錄人耳聽得到的頻率, 再往上加並不會讓「聽得到的部分」變得更精確。因為奈奎斯特定理說的是 「可以完整還原」,不是「勉強還原」。
年輕人的聽覺上限大約 20 kHz,而且會隨年齡下降, 多數成年人其實只剩 15 到 17 kHz。 44.1 kHz 的奈奎斯特頻率 22.05 kHz 已在 20 kHz 之上; 96 kHz 的 48 kHz 上限,對耳朵而言完全用不到。
取樣率不夠時,高頻不會「消失」,而是會摺疊成一個不存在的低頻。 例如用 40 kHz 取樣去錄 25 kHz 的訊號,結果聽起來會像 15 kHz,而且事後無法移除。 所以 DAC 與 ADC 前面都要有抗混疊濾波器。
好處確實存在,但多半在製作端而不是播放端:
代價是:檔案變大(96 kHz/24-bit 立體聲約是 CD 的 7.5 倍), 對 DAC 的時鐘與類比電路要求更高;而且訊號一旦需要轉換取樣率, 轉換本身就會引入誤差。
真正該注意的事: 把 44.1 kHz 的音樂用 96 kHz 播放,中間一定得做一次重取樣, 不會讓音質變好,只會多一道手續。原則很簡單: 讓取樣率一路保持原樣。
電腦裡的「音效」可以分成三種做法,它們解決的問題並不相同。
主機板上有一顆小小的音效編解碼晶片,同時負責 DAC 與 ADC,便宜、不占空間。 問題在於它住的地方:同一塊板子上有處理器的高速供電與顯示卡,全是干擾來源。 更麻煩的是機殼前面板音訊孔——那條線沒有屏蔽、又穿過整個機殼,底噪自然壓不低。
插在擴充槽上的音效卡,優勢是可以自己做屏蔽與供電, 通常能提供更高的輸出電壓與更低的輸出阻抗。缺點是它仍在機殼裡,干擾只是被隔開。
把類比電路整組搬到機殼外面,是最有效的一招。傳輸方式常見兩種:
| 方案 | 解決了什麼 | 沒解決什麼 | 適合誰 |
|---|---|---|---|
| 內建音效 | 成本最低、免接線、免驅動 | 干擾、供電雜訊、推力有限 | 看影片、開會、一般耳機 |
| 獨立音效卡 | 屏蔽與供電較好、輸出電壓較大 | 仍在機殼內,干擾只是被隔開 | 需要多組輸入輸出的人 |
| 外接 DAC/耳擴 | 類比電路移出機殼、推力通常最強 | 多一組線與變壓器、USB 供電仍需注意 | 用高阻抗或低靈敏度耳機的人 |
別把順序搞反: 如果您用的是低阻抗、高靈敏度的耳機,換 DAC 的效益遠不如 把前面板的線換到後面板。器材升級要從最弱的一關下手, 而不是最貴的一關。
很多人以為「耳機阻抗高=音質好」,其實阻抗只是規格, 它真正決定的是「要推得響,需要多少電壓與電流」。
功率 P = 電壓 V² ÷ 阻抗 R 電流 I = 電壓 V ÷ 阻抗 R
關鍵是:阻抗越高,同樣的輸出電壓只能換到越少的功率。 要讓高阻抗耳機達到同樣音量,就得灌進更高的電壓; 低阻抗耳機雖然容易取得功率,卻需要更大的電流。
靈敏度是「每單位功率能發出多大的音壓」,單位常見 dB/mW
或 dB/V。阻抗決定要多少電壓,靈敏度決定能換到多響,兩者合起來才是答案。
| 耳機特性 | 阻抗 | 靈敏度 | 達到 110 dB 音壓所需功率 | 所需電壓 | 所需電流 |
|---|---|---|---|---|---|
| 高靈敏度入耳式 | 16 Ω | 105 dB/mW | 約 3.2 mW | 約 0.22 V | 約 14 mA |
| 一般耳罩式 | 32 Ω | 100 dB/mW | 約 10 mW | 約 0.57 V | 約 18 mA |
| 高阻抗耳罩式 | 300 Ω | 97 dB/mW | 約 20 mW | 約 2.45 V | 約 8 mA |
| 低靈敏度平板式 | 60 Ω | 88 dB/mW | 約 158 mW | 約 3.08 V | 約 51 mA |
這張表藏著整節的答案:高阻抗耳機缺的是電壓, 低靈敏度耳機缺的是功率與電流。耳機孔通常只有約 0.3 到 1 V 的輸出電壓,推 300 Ω 的耳機自然又小聲又單薄;獨立耳擴可達 2 到 7 V, 平衡輸出還能再加倍。
耳機的阻抗不是固定的——它隨頻率變化。當放大器的輸出阻抗不可忽略時, 分壓比例會隨頻率改變,等於對耳機做了一次「不想要的等化」, 最常見的症狀就是低頻變多、聲音變糊。
判斷要不要買耳擴的三步驟: 一、查耳機的阻抗與靈敏度; 二、算一下達到習慣音量需要多少電壓; 三、看手上的裝置能給多少。差很多才值得換耳擴;只差一點, 先確認是不是數位音量開太小。
音效規格表上的數字很多,但真正有意義的就那幾個。 讀的時候有一個原則:沒有標明測試條件的數字,等於沒有意義。
| 指標 | 白話意思 | 常見範圍 | 怎麼看 |
|---|---|---|---|
| 訊噪比 SNR | 最大訊號與底噪的差距 | 內建 90~100 dB;外接 110~125 dB | 看是否標明 A 加權(數字通常好看 2~4 dB) |
| 總諧波失真 THD | 訊號被扭曲後多出來的倍頻成分 | 內建約 0.01%;好的低於 0.001% | 越低越好,但有聽覺門檻 |
| THD+N | 失真加噪聲的綜合指標 | -80 dB 到 -115 dB | 要知道是在什麼輸出電平下量的 |
| 互調失真 IMD | 兩頻率同時通過時產生的非諧波成分 | 多半低於 0.01% | 比 THD 更接近人耳對「吵」的感受 |
| 串音 Crosstalk | 左聲道漏到右聲道的程度 | 內建約 -60 dB;好的低於 -100 dB | 越大越好,影響音場寬度與定位 |
| 輸出阻抗 | 放大器輸出端的等效內阻 | 好的設計低於 1 Ω | 應小於耳機阻抗的 1/8 |
| 輸出功率 | 特定阻抗下能輸出多少功率 | 常見標 32 Ω 與 300 Ω 兩組 | 一定要看是在幾歐姆下量的 |
指標好到某個程度之後,差異就超出人耳的辨識能力。 失真低於約 -80 dB(0.01%)之後就很難察覺; 噪聲只要低於實際環境的背景噪音,再低也沒有意義。 真正該在意的是指標會不會在實際條件下崩壞。
最常見的規格陷阱: 兩台器材比 THD+N,一台標「-110 dB」、一台標「0.001%」,看起來前者大勝—— 換算後其實是同一件事。更常見的是沒標測試條件:在一伏特輸出下量的漂亮數字, 拿去推需要三伏特的耳機時完全不是那麼回事。
「嘶嘶聲」「嗡嗡聲」「電腦一忙起來就變吵」——這些症狀都有明確的物理來源, 而且幾乎都發生在類比那一段。
為什麼平常沒感覺?因為底噪是固定的,音樂是變動的。 音樂大聲時底噪被蓋住,只有在安靜段落才聽得見。而高靈敏度的入耳式耳機 就像放大鏡——同樣的底噪,它聽起來比一般耳罩明顯得多。
安全提醒: 網路上常有人教「把電源線的地腳折斷」來解決接地哼聲。請不要這麼做—— 那會讓機殼失去保護接地,一旦內部絕緣失效就可能帶電。 正確做法是改用光纖隔離、外接 DAC, 或合格的音訊隔離變壓器。
這是電腦音效最容易被忽略、卻天天在發生的一關。系統混音器必須同時處理 播放程式、瀏覽器分頁、通訊軟體、系統提示音,它們的取樣率很可能都不一樣, 最後卻只能送到 DAC 一次。
把 44.1 kHz 轉成 48 kHz,並不是「補幾個點」那麼簡單——新的取樣點落在原本兩點之間, 必須用濾波器重建出那個瞬間的電壓,這就是取樣率轉換(SRC)。
數位音量是把每個取樣點乘上一個小於 1 的係數。每衰減約 6 dB 就少掉 1 個位元;降到 -30 dB 等於丟掉 5 個位元,16 bit 只剩約 11 bit 的解析度,動態範圍從 96 dB 掉到 66 dB。
實用的設定原則: 一、輸出格式設成來源的取樣率; 二、系統音量盡量開大,改由耳擴或喇叭調整; 三、若支援獨佔模式,可繞過系統混音器; 四、升頻對已錄好的檔案不會增加任何資訊。
| 系統音量位置 | 等效衰減 | 16 bit 剩下的有效位元 | 大約的動態範圍 |
|---|---|---|---|
| 最大 | 0 dB | 16 bit | 約 96 dB |
| 約一半 | -18 dB | 13 bit | 約 78 dB |
| 明顯偏小 | -30 dB | 11 bit | 約 66 dB |
| 幾乎聽不見 | -48 dB | 8 bit | 約 48 dB |
聲道數指的是「有幾路獨立的音訊」。聲道越多, 理論上越能把不同方向的聲音分開放置,但這不等於一定比較好聽。
| 配置 | 聲道組成 | 常見場合 | 重點 |
|---|---|---|---|
| 立體聲 2.0 | 左、右 | 音樂欣賞、耳機 | 靠左右兩支喇叭或耳機建立音場與定位 |
| 2.1 | 左、右、重低音 | 桌面喇叭 | 重低音只負責低頻,可獨立調整 |
| 5.1 | 前左、前右、中置、環繞左、環繞右、重低音 | 影片、遊戲 | 中置負責對白——對白清不清楚,中置影響最大 |
| 7.1 | 5.1 再加側左、側右 | 較大的視聽空間 | 多了側面,前後移動的連續感更好;空間不夠反而容易失敗 |
耳機只有左右兩邊,卻能讓人感覺聲音從後方或上方來,靠的是HRTF (頭部相關傳遞函數)。聲音從某個方向傳來時,會因為兩耳的時間差、 音量差與耳廓造成的頻率變化而帶著獨特「指紋」。 虛擬環繞就是用濾波器模擬這些指紋,再配合串音消除。
限制也很明顯:每個人的耳廓形狀都不同,同一組 HRTF 套在所有人身上, 效果自然因人而異。
順帶一提: 有些錄音是假人頭錄音——把麥克風裝在人造頭顱的耳朵裡。 這種錄音用耳機聽非常逼真,用喇叭聽卻很奇怪, 說明了立體聲本來就是為特定播放條件設計的。
以下這些說法在網路上非常常見,但大多只對了一半:
1. 取樣率越高,音質就一定越好?
不一定。只要取樣率足以記錄人耳可聽的頻率, 再往上加並不會更精確,價值主要在錄音與後製階段。
2. 24-bit 聽起來一定比 16-bit 好?
要看情況。真正的好處是數位音量控制更有餘裕; 若音量本來就開到最大,兩者差別極小。
3. 耳機阻抗越高,音質就越好?
錯。阻抗只是「需要多少電壓才推得動」的規格。 真正決定好不好聽的是單體設計、腔體與調音。
4. 只要買了耳擴,聲音就會變好?
錯。原來推得動的話差別微乎其微;若問題出在 底噪、接地或來源檔案,換耳擴更沒幫助。
5. 電腦的底噪是數位訊號造成的?
錯。底噪是類比端的問題——機殼內干擾、 USB 供電、接地迴路、前面板走線。換成 24-bit/192 kHz 的檔案,嘶嘶聲也不會變小。
6. 把系統音量調小一點,只是變小聲而已?
不完全是。每衰減約 6 dB 就少掉約 1 個位元的解析度。 音量長期壓得很低,等於讓 16 bit 縮水到 12 bit。
7. 5.1 聲道一定比立體聲更震撼?
不一定。聲道數只是材料,擺位、空間聲學與校正品質 影響更大。小房間硬塞六支喇叭,常比一對擺得好的立體聲更糟。
8. 用耳機聽虛擬環繞,就等於真的有六支喇叭?
不能畫上等號。它用 HRTF 與串音消除模擬, 效果高度依賴個人的耳廓形狀,且通常犧牲一些音質與動態。
9. 規格數字越好,聽起來就一定越好?
不一定。失真低於約 -80 dB、噪聲低於環境背景之後, 差異就超出人耳的辨識範圍。更該注意的是指標會不會在實際條件下崩壞。
整篇的主線只有一條:鏈路中最弱的一關,決定了整體的表現。 用 24-bit/192 kHz 的檔案搭配高階 DAC,卻從前面板拉一條無屏蔽的線出來, 結果一樣是嘶嘶作響。
所以下次看到「24-bit/192 kHz」「訊噪比 120 dB」這些字眼時,可以多問一句: 它是在什麼條件下量出來的?我的使用情境真的用得到嗎?
給一般讀者的一句話: 電腦音效不是「規格越高越好」的競賽,而是一條從檔案到耳朵的接力賽—— 任何一棒掉棒,前面跑得再快都沒有用。
本文為科普整理,內容取材自網路上的數位音訊與音效電路教材,經重新編寫與白話化而成。
文中數據為常見範圍的概略值,僅供理解參考;實際規格與行為請以各廠商官方技術文件與相關標準為準。