2026年9月1日火曜日

ボーカル補正、どこまで直せて、どこから気づかれるのか



「最近の曲って全部機械で直してるんでしょ」

音楽の話になると一度は出てくる台詞です。反対側にはこういう誤解もあります。補正をかけたら声が不自然になってしまい、「やっぱり補正はバレるんだな」と諦めてしまうケース。

どちらも同じところでつまずいています。補正に何ができて何ができないのかを知らないのです。

今日はその線をはっきり引きます。どこまでは跡形もなく直り、どこからは必ず気づかれるのか。そして実際のかけ方まで。

① 補正は「いちばん近い音へ押す」道具です 🎯

原理を一行でまとめるとこうなります。

入ってきた音の高さを測り続けて、あらかじめ決めておいた音のうち、いちばん近いところへ押し上げるか押し下げる。

ここで二つのことが決まっている必要があります。

🔹 どこへ押すのか — 目標となる音のリスト

曲のキーとスケールを指定すると、その中の音だけが目標になります。Cメジャーを指定すればド・レ・ミ・ファ・ソ・ラ・シの七つが着地点になるわけです。

🔹 どれくらい速く押すのか — リチューン・スピード

目標まで引き寄せるのにかかる時間です。ゆっくり引き寄せれば人の耳にはただ上手に歌ったように聞こえ、即座に引き寄せれば階段を踏むようにカクカクと張りついて機械的な音になります。

この二つが補正のほぼすべてです。残りはこの二つを状況に合わせて調整する仕掛けです。

② どれだけ外れたかがすべてです 📏

ここが今日の核心です。

🔹 セントという単位

音程の細かい差を測る単位があります。セント(cent)といって、半音一つを100セントに分けます。ピアノでドとド♯のあいだが100セントですね。

人が歌うとき、完璧に正確な音を出すことはありません。上手な人でも一瞬ごとに少しずつ揺れています。問題はその揺れの大きさです。

🔹 10〜20セントのズレ — 跡形もなく直ります

移動距離がごく短いので、補正の痕跡が残りません。そもそもこの程度の誤差は、たいていの聴き手が「外れている」とすら感じません。細かな揺らぎ程度に聞こえます。

🔹 30〜50セントのズレ — 直りますが要注意です

半音の3分の1から半分ほど外れた状態です。直せはするのですが、リチューン・スピードが速いと音が滑るのが聞こえます。ゆっくり引き寄せれば自然になる代わりに、音が短いと引き寄せ切る前に終わってしまいます。

🔹 半音(100セント)以上のズレ — 直すほど気づかれます

移動距離が大きすぎるため、無理に引っ張ると音が不自然に滑ったり、金属的に跳ねたりします。「あ、オートチューンかかってるな」とすぐわかるのは、たいていこの場合です。

そしてもっと厄介な問題があります。どの音へ押すべきか機械が迷います。 半音より大きく外れると、本来意図した音より隣の音のほうが近くなることが起きるからです。そうなると、まったく別の音へ直されてしまいます。

📌 結論は単純です

補正は小さな誤差を消す道具であって、大きな誤差を取り戻す道具ではありません。 だから「音痴でも歌手になれますか」への答えはノーです。大きな誤差は直すほど目立ちます。

③ 実際の設定値 🎚️

自動補正モードで触るものです。製品によって名前は少しずつ違いますが、やっていることはだいたい同じです。

🔹 キーとスケール — まず最初に、いちばん大事

曲のキーを間違えて入れると、残りをどれだけ丁寧に合わせても意味がありません。存在しない音へ引っ張られてしまうからです。迷うなら、スケールをクロマチック(12音すべてを目標にする)にする手もあります。間違った音へ引っ張られる危険はなくなりますが、代わりに外れた音もそのまま残ります。

🔹 リチューン・スピード — 自然さのつまみ

20〜50ms程度が自然な補正の一般的な範囲です。曲によっては20〜80msまで使うこともあります。

速い曲は音が短いので値を下げる必要があり(でないと補正が終わる前に音が終わります)、ゆっくりで表現の多い曲は値を上げたほうがよくなります。

0にすると、あの有名なロボット声になります。これは失敗ではなく選択です。最初からエフェクトとして使う場合ですね。

🔹 ゆるく通す機能 — 表現を生かす仕掛け

製品によってフレックス・チューンなどの名前で入っています。目標の音のまわりに「触らない領域」を作って、少し外れた程度の表現はそのまま通し、大きく外れたものだけを捕まえます。

自然な補正ではほぼ常にオンにしたほうがいいです。開始値は15〜30あたりをおすすめします。

🔹 ヒューマナイズ — 長く伸ばす音を生かす仕掛け

長い音でだけ補正をゆるめます。なぜ必要かというと、ビブラートのためです。

歌手が長く伸ばす音で声を震わせると、それは音程が上下に動き続けている状態です。補正がこれを一生懸命に捕まえると、震えが消えて音が板のように平らになります。人の声ではなくシンセのように聞こえてしまうわけです。

かける順番があります。まずヒューマナイズを0にしてリチューン・スピードで短い音を合わせ、長い音が硬いと感じたらそこでヒューマナイズを10〜20ほど上げます。

④ 手で直す方法 ✏️

自動補正とは別に、グラフに描かれた音を直接つかんで動かす方式があります。画面に歌った音程が線や塊で描かれ、それをマウスで上下に動かすわけです。

🔹 自動補正と何が違うのか

自動はルールを決めて機械に任せます。速い代わりに、触ってほしくないところまで触ります。手でやる方式は外れた音だけを選んで、そこだけ直せます。

🔹 いつ使うのか

一、二か所だけ外れた良いテイクに使います。全体に自動補正をかけると上手に歌えた部分まで潰れるので、問題になる三つの音だけ動かすほうがずっと自然です。

🔹 コツ

音を丸ごと動かすより、音の出だしはそのままにして、伸びている区間だけを少し動かすほうが自然になります。人の声はもともと音の始まりで少し滑り込むものだからです。そこまで正確にしてしまうと、かえって機械的に聞こえます。

⑤ フォルマント — 声が不自然になる本当の理由 👤

補正をかけたのに、音程は合っているのに声が変になった。そういうときは、たいていここです。

🔹 フォルマントとは

人の声には、音程とは別に、その人の喉や口の構造が作る固定的な響きがあります。これをフォルマントといいます。

重要なのはここです。歌っているあいだ音程が上下しても、この響きの位置は大きく変わりません。 喉の長さは音を上げたからといって短くなりませんから。私たちがある人の声を聞き分けられるのも、この響きのおかげです。

🔹 なぜリスの声になるのか

音程を上げるときに音全体を丸ごと持ち上げてしまうと、この響きまで一緒に上がります。すると喉が急に短くなった人のように聞こえます。録音を早回しで再生したときのあの音です。

そのため最近の補正ツールには、フォルマントを元の位置に固定しておく機能があります。音程だけを動かして、声の性格はそのままにするわけです。

🔹 実際には

大きく動かすほどこの問題が大きくなります。20セント動かす程度なら気づかれませんが、半音以上動かすとはっきり聞こえます。大きく動かさざるをえない場面ではフォルマント補正をオンにしてください。 そしてこれは、さきほどの「大きく外れたものは直すな」という話と同じ結論につながります。

📌 逆にわざと使うこともあります

フォルマントだけを上下させると、音程はそのままで声の性格が変わります。少し下げると太く重くなり、上げると明るく軽くなります。コーラスのトラックに軽くかけて、元の声と違って聞こえるようにする用途にも使われます。

⑥ 音程ではなくタイミング ⏱️

意外と見落とされがちな部分です。

歌が不自然に聞こえる理由は、いつも音程とは限りません。拍がずれている場合も同じくらい多いのです。とくに何度も録って重ねたコーラスやダブリングで目立ちます。二つのトラックの子音がわずかにずれると、発音がぼやけて汚くなります。

🔹 何を合わせるのか

音の始まる地点、とくに子音が弾ける瞬間を合わせます。母音は多少ずれても聞こえにくいのですが、子音はすぐに気づかれるからです。

🔹 どこまで合わせるのか

全部合わせると、今度は人らしくなくなります。基準となるトラックを一つ決めて、残りをそこに合わせる程度で十分です。とくに最後の単語の終わる地点を合わせるだけでも、かなり整います。

順番としてはタイミングを先に、音程をあとにするほうが楽です。タイミングが整うと音程の問題も減ることが多いからです。

⑦ 直してはいけないもの 🚫

この記事でいちばん大事な部分かもしれません。

🔹 ビブラート

長く伸ばす音の震えです。これを捕まえると歌が死にます。さきほどのヒューマナイズが必要な理由ですね。

🔹 音への滑り込み

人は目標の音にぴったり着地しません。少し下から滑り上がったり、上から降りてきたりします。これはミスではなく表現です。これを消すと、歌ではなくシンセになります。

🔹 わざと低めに取った切ない音

ある種の感情表現は、意図的に音を少し低く取ります。ブルース系ではとくにそうですし、バラードでもよくあります。これを正確に合わせると感情が消えます。

🔹 そして機械がそもそも直せないもの

どこで息を吸い、どの言葉に力を込め、いつ声を飲み込むか。 聴く人の心を動かすのは、たいていこちら側です。補正は高さという座標を一つ動かすだけで、そこに込められた表現を作ってはくれません。

CGがどれだけ進化しても演技の代わりにはならないのと同じです。ピクセルは整えられても、演技は人の仕事ですから。

⑧ 録りの段階でやると補正が半分になります 🎤

いちばん効率のいい補正は、補正を減らすことです。録音の段階でできることが結構あります。

🔹 キーを変えてみてください

ずっと外れる箇所があるなら、その音が音域の限界にかかっている可能性が高いです。曲全体を一音下げるだけでその区間がまるごと解決することが本当によくあります。補正で格闘する前に、まずこれを試してください。

🔹 モニターの音量を調整してください

ヘッドホンで伴奏が大きすぎると自分の声が聞こえず音程が揺れます。逆に自分の声だけ大きいと感情が乗りません。録る前にこのバランスを取るのに数分使うことが、あとで数時間を節約します。

🔹 難しい区間だけ別に録ってください

一度で全部歌おうとすると、難しいところで失敗し続けます。その部分だけ何度も歌って良いものを選べばいいのです。これをつなぐほうが補正よりずっと自然になります。

🔹 実力ではなく方法の問題であることが多いです

同じ人が同じ曲を歌っても、体調・時間帯・マイクとの距離で結果は大きく変わります。10回歌ってもだめならその日は切り上げる、というのも一つの方法です。

⑨ よくある失敗 五つ ⚠️

🔹 キーを合わせずにかける

いちばん多く、いちばん致命的です。曲のキーを確認してから始めてください。

🔹 リチューン・スピードを0にして「なぜロボット声になるのか」と悩む

0はロボット声を出せという設定です。自然にしたいなら20以上に上げてください。

🔹 トラック全体に強くかける

上手に歌えた部分まで潰れます。問題のある区間だけ手で直すほうがいい場合が多いです。

🔹 補正をかけて原音と比べない

かけたあとは良くなった気がしますが、オンオフを切り替えると原音のほうがいい区間が必ずあります。区間ごとに比べてください。

🔹 補正で実力を代替しようとする

さきほど見たとおり、大きな誤差は直すほど気づかれます。もう10回歌うほうが速いです。

⑩ Q&A 💬

Q. 補正を使うのは恥ずかしいことですか。

A. まったく違います。今出ているポピュラー音楽の大多数が何らかの形で補正を通っています。化粧に近いと考えてください。下地が良いほど自然にのりますし、下地がなければバレるのも同じです。

Q. 無料でもできますか。

A. できます。DAWに標準で入っている補正ツールがある場合も多く、無料のプラグインもあります。基本原理は同じなので、キーとリチューン・スピードさえあれば十分に作業できます。

Q. わざとロボット声を出すにはどうしますか。

A. リチューン・スピードを0に、スケールを曲のキーに正確に合わせ、歌手が音程をはっきり移動させながら歌うことです。最後の条件が重要で、音程の移動がはっきりしていないと階段の効果が聞こえません。 のっぺり歌うとロボット声になりません。

Q. コーラスにも補正をかけますか。

A. たいていメインより強めにかけます。何層も少しずつずれると和音がぼやけるからです。ただ全部が同じように正確になると一人で歌ったように聞こえて厚みが消えるので、層のあいだに多少の差は残したほうがいいです。

Q. 補正をかけると音が細くなる気がするのですが。

A. 移動量が大きいときに起きる現象です。フォルマント補正をオンにしてみて、それでも細いなら移動量そのものを減らす方向(録り直す、キーを変える)を考えてください。

Q. ミックスの順番で補正はいつやりますか。

A. いちばん最初です。正確にはテイクを選んでつなぐ編集の直後ですね。EQやコンプを先にかけておくと補正ツールが音程を読むのに邪魔になることがありますし、あとからチューニングをやり直すと先の作業が無駄になります。

Q. ライブでも使いますか。

A. 使います。リアルタイムでかけられる機材やプラグインがあります。ただ少し遅延が出ますし、複数の人の声がマイクに混ざって入ると音程を読み間違えることもあるので、スタジオほど正確ではありません。

⑪ 今日やること ✍️

歌ったボーカルのトラックが一つあれば十分です。

1. 曲のキーを確認する — わからなければコード進行の最初のコードから見当をつける

2. 補正ツールをかけて、キーとスケールを正確に入れる

3. リチューン・スピードを0にして一度聴く — ロボット声を確認する

4. リチューン・スピードをゆっくり上げて、ロボット感が消える地点を探す(たいてい20〜50のあいだ)

5. ゆるく通す機能(フレックス・チューンなど)をオンにして20あたりに合わせる

6. 長く伸ばす音が硬ければヒューマナイズを10〜20上げる

7. 補正をオンオフしながら区間ごとに比べる

8. 原音のほうがいい区間を探す — 必ずあります

9. その区間は補正を外し、本当に外れた二、三音だけ手で動かす

8番が今日の核心です。 補正をどれだけ上手にかけるかより、どこにかけないかを判断することが結果を分けます。

機械は音程を直し、人は心を歌います。順番を入れ替えると両方を失います。

おわりに

今日の内容を一行にまとめるとこうなります。

「補正は小さな誤差を消す道具である — 大きく外れたものは、直すほど目立つ」

みなさんはボーカル補正をどこまでやりますか。コメントで教えてください。スキとフォローも大きな励みになります 🙏

#ボーカル補正 #ピッチ補正 #オートチューン #フォルマント #ボーカルミックス #DTM #音楽制作 #宅録 #ミックス #レコーディング

ボコーダーとトークボックスの違い — なぜ違って聞こえるのか

クラフトワークの「Autobahn」で聞こえるあの声と、ピーター・フランプトンのギターが人のようにしゃべる音。どちらも「ロボットボイス」とひとくくりにされますが、並べて聴くとはっきり違います。ボコーダー側は硬くて、層になっています。金属を薄く削いだような質感です。トークボックス側はもっとぬめりがあって、粘っこい。人の口から出た跡が残っています。

この違いは好みの問題でも、後処理の問題でもありません。音が作られる場所そのものが違います。 ボコーダーは回路の中で音を組み立て、トークボックスは奏者の口の中で音を削り出します。同じ結果になるはずがないんです。今回はこの2台を原理から切り分けて、なぜ一方はドイツの電子音楽の象徴になり、もう一方はアメリカのギタリストの道具になったのかまで追いかけます。


① 結論から — 音を削る刃がどこにあるか

どちらも「楽器の音に人のことばを乗せる」という目的は同じです。分かれるのは、その作業をどこでやるかです。

🔹 ボコーダー — 刃が回路の中にあります

マイクに向かってしゃべった声は、スピーカーからは出ません。声はあくまで分析用の資料としてだけ使われます。機械がその声を周波数帯域ごとに分けて、「今この帯域がどれくらい大きいか」だけを数値として取り出し、その数値をシンセの音にそのまま被せます。最終的にスピーカーから出る音は100パーセントシンセの音です。人の声帯から出た空気はひと粒も混ざっていません。

🔹 トークボックス — 刃が奏者の口の中にあります

ギターの音が小さなスピーカー(ドライバー)に送られ、その音がプラスチックのチューブを通って奏者の口の中へ入ります。奏者は声を出しません。口の形だけを作ります。舌と唇と顎が動くと、チューブから上がってきたギターの音が削られていく。削られて出てきた音を、目の前のマイクがもう一度拾います。実際に人の口の中の空間を通った音です。

一方は計算、もう一方は物理。この一行が今回の記事のすべてと言ってもいいくらいです。

言葉で説明するより、並べて聴いてみてください。下の2曲はどちらも「ロボットボイス」とまとめられますが、音を削った場所が違います。

▶ Kraftwerk - Autobahn — ボコーダー。硬く層になる質感です

▶ Peter Frampton - Show Me the Way — トークボックス。ぬめりがあって、人の口の跡が残ります

② ボコーダーの原理 — 声から「形」だけを盗んできます

もう少し中に入ってみましょう。ボコーダーの中には、同じフィルターの束が2組入っています。

声が入ってくる側が分析部です。ここで声を低い帯域から高い帯域まで、いくつもの区画に分けていきます。区画の数は機種によりますが、8から20くらいが一般的でしょうか。各区画にはエンベロープフォロワーという回路がついていて、これは「この区画に今どれくらいの大きさで音が入っているか」だけをリアルタイムで読み取る装置です。音程でもなく、音色でもなく、大きさだけ。

シンセの音が入ってくる側が合成部です。こちらも同じ数の区画に分かれています。そして分析部で読み取った大きさの値を、同じ番号の区画にそのまま当てはめる。分析部の3番の区画が大きくなれば、合成部の3番も一緒に大きくなる、という具合です。

しゃべるというのは、結局のところ口の形を変えて特定の帯域を持ち上げ、別の帯域を殺す作業です。「あ」と「い」を分けているのは声帯の振動ではありません。口の中でどの帯域が強調されるか。だから帯域ごとの大きさの変化だけを移し替えても、ことばは移っていきます。ボコーダーは声からことばの骨格だけを剥がして、別の音に貼りつける機械です。


Roland VP-330 Vocoder Plus — ストリングスと合唱を積めるボコーダー内蔵シンセ

Roland VP-330 Vocoder Plus — ストリングスと合唱を積めるボコーダー内蔵シンセ / 出典: ghostdad / CC BY-SA 2.0 via Wikimedia Commons

ここから重要な帰結がひとつ出てきます。音程はシンセが決めます。 奏者がどれだけ高い声でしゃべっても、鍵盤で低いドを押せば音は低いドです。逆に口を閉じて鍵盤だけを押しても音は出ます。ことばにならないだけです。ボコーダーで和音が作れる理由もここにあります。鍵盤で3つの音を同時に押せば、3つの音が同じ文をいっせいにしゃべるからです。人ののどでは不可能なことです。

🔹 ボコーダーが苦手なこと

「さ」「ち」のような摩擦音・破裂音がつぶれます。これらは特定の帯域が大きくなる音ではなく、広い帯域にノイズがばらまかれる音なので、区画に分けて大きさだけを読む方式とは相性がよくありません。そのため実機のボコーダーにはノイズチャンネルが別についていることが多いです。子音が入ってきたときだけホワイトノイズを少し混ぜて発音を立たせる仕組みです。この回路が貧弱な機種は歌詞が聞き取りづらくなります。

③ トークボックスの原理 — アンプを口にくわえます

トークボックスは構造がずっと単純です。回路らしい回路がほとんどありません。

順番はこうです。ギターの信号がアンプを通って、トークボックスの中の小さなドライバーに行きます。ドライバーは音を外にばらまく代わりに、細い管ひとつからだけ出します。その管がプラスチックのチューブです。チューブの先はマイクスタンドにテープで固定され、奏者の口のそばに来ます。奏者がチューブをくわえると、ギターの音が口の中の空間へ押し込まれます。

ここからが核心です。口の中はそれ自体が優秀な可変フィルターです。舌を上げ、顎を開き、唇をすぼめると空間の形が変わり、ある周波数は生き残り、ある周波数は死にます。人間が一生無意識にやっていることです。普段は声帯から上がってきた音を削り、トークボックスをくわえたときはギターから上がってきた音を削る。材料が変わっただけです。

そうやって削られた音が唇のあいだから漏れ出し、すぐ前のボーカルマイクがそれを拾ってPAに送ります。


Dunlop Heil Talk Box — ボブ・ハイル設計の定番機。中央の穴からチューブが伸びます

Dunlop Heil Talk Box — ボブ・ハイル設計の定番機。中央の穴からチューブが伸びます / 出典: kevin / CC BY 2.0 via Wikimedia Commons

🔹 だから生まれる特徴

音がやけに人間くさいのは、実際に人間の口を通っているからです。唾の音、息の音、舌がぶつかる音まで細かく混ざります。ボコーダーがどれだけ精巧でも真似しにくい部分です。

🔹 だから生まれる不便さ

口がフィルターとして塞がっているので、歌えません。トークボックスをくわえているあいだ、奏者の口は楽器の一部です。おまけにチューブの中はすぐ湿りますし、音量を上げると歯が響きます。ロジャー・トラウトマンのように1曲まるごとトークボックスで歌うのは、体力と練習が要る話です。

④ 実戦で分かれる5つのこと

原理の違いが実際の作業でどう出るかをまとめると、こうなります。

🔹 音程を誰が決めるか

ボコーダーは鍵盤が決め、声の音程は無視されます。トークボックス側はギター(またはシンセ)で、こちらも声の音程は関係ありません。どちらも「歌う声」ではなく「しゃべる口の形」だけを必要とする点は共通しています。

🔹 和音になるか

ボコーダーはなります。鍵盤でコードを押せば、コード全体がまとまってしゃべってくれる。トークボックスも原理上は可能ですが、ひとつの口の空間を通る音なので和音が団子になりがちで、普通は単音で使います。

🔹 発音がどれだけはっきりするか

よくできたトークボックスのほうが概してはっきりします。本物の口を使っているからです。ボコーダーは区画の数に左右されます。区画が少ないとつぶれ、多いとはっきりする代わりに独特の機械的な質感が薄まります。

🔹 ステージでどれだけ面倒か

ボコーダーはマイクをもう1本挿せば終わりです。トークボックスは別のアンプラインとチューブの固定、それに衛生管理までついてきます。ボブ・ハイルがジョー・ウォルシュの依頼で頑丈なトークボックスを作らざるをえなかった理由もこれです。既製品ではステージに耐えられませんでした。

🔹 音の性格

ボコーダーは層になります。区画に分けて組み直した音なので、階段のような質感が残ります。これが欠陥ではなく魅力として定着しました。トークボックスは連続的でなめらかです。口の形がアナログに変わるので、中間の段階が全部生きています。


⑤ ボコーダーはなぜ軍事技術から出てきたのか

ボコーダーの出発点は音楽ではありませんでした。1928年にベル研究所のホーマー・ダドリーが始めた研究です。目的はひとつでした。大西洋を横断する電話線は高価で、人の声をそのまま送るには帯域幅がもったいなかったのです。そこでダドリーはこう考えます。声そのものを送るのではなく、声を説明する情報だけを送ろう。受け取る側でその説明どおりに音を作り直せばいいのではないか。

この発想がボコーダー(voice + coder)です。特許は1937年と1939年に出ています。

ダドリーはこの仕組みを逆から使って、人が手で演奏する機械も作りました。ヴォーダー(Voder)です。マイクがそもそもなく、鍵盤と手首のバー、フットペダルで音声を直接組み立てる代物です。1939年のニューヨーク万国博覧会で、訓練を受けた女性オペレーターがこれを演奏し、観客の前で機械にしゃべらせました。扱えるようになるまで数か月かかったといいます。

その次がSIGSALYです。1943年にベル研究所が作った連合軍最高位の通信暗号装置です。ボコーダーで声を数値情報に変えたうえに雑音をかぶせて暗号化する方式でした。チャーチルとルーズベルトの通話がこの装置を通っています。重量は数十トン、その存在自体が数十年間機密でした。

SIGSALY(1943年)— ボコーダーを暗号装置として使った最初の実用機

SIGSALY(1943年)— ボコーダーを暗号装置として使った最初の実用機 / 出典: U.S. Army / Public domain via Wikimedia Commons

音楽に移ってきたのは1970年です。ウェンディ・カルロスとロバート・モーグが10バンドの音楽用ボコーダーを作り、この音が1971年の映画『時計じかけのオレンジ』のサウンドトラックに載ります。そしてクラフトワークが1973年の『Ralf und Florian』で初めて使ったあと、1974年の『Autobahn』で一般に刻みつけました。電話代を節約しようとした回路が、40年かけて電子音楽の声になったわけです。

▶ Kraftwerk - Die Roboter / The Robots — ボコーダーの音の教科書として通っています

⑥ トークボックスはなぜギタリストの道具になったのか

トークボックスの系譜はもっと手仕事寄りです。正式な発明というより、誰かがいたずら半分でたどり着いたものに近いです。

1930年代後半から40年代にかけて、スチールギター奏者のアルヴィノ・レイが軍用の首かけマイクを歌手の喉に当て、自分のギターの音を送り込む実験をしました。商品化された最初の製品は1939年、ギルバート・ライトのソノヴォックス(Sonovox)です。喉に当てる振動子を使う方式で、ルシル・ボールが実演し、1941年のディズニー『ダンボ』では機関車ケイシー・ジュニアの声に使われました。

いま私たちが知っている「チューブをくわえる」方式は1960年代に出てきます。ペダルスチール奏者のビル・ウェストがこの方法を考案し、ピート・ドレイクが1964年の「Forever」で使ってミリオンセラーになりました。60年代末にはカスタム社のThe Bagが出て、初めて量産品になります。

ステージで使えるものを作ったのはボブ・ハイルです。ジョー・ウォルシュに頼まれて作り、それがハイル・トークボックスになりました。ほとんどの人がこの音を初めて聴いたのは、ウォルシュの1973年「Rocky Mountain Way」でした。

▶ Joe Walsh - Rocky Mountain Way — ハイル・トークボックス

そして忘れてはいけないのがピーター・フランプトンです。1970年にピート・ドレイクからこの道具を紹介されました。彼がトークボックスを世界に知らしめたのは1976年のライブアルバム『Frampton Comes Alive!』です。「Do You Feel Like We Do」と「Show Me the Way」、この2曲で十分でした。のちに自分の名を冠したFramptone(フランプトーン)というブランドまで立ち上げています。

ピーター・フランプトンとトークボックス — チューブがマイクスタンドに固定されているのが分かります

ピーター・フランプトンとトークボックス — チューブがマイクスタンドに固定されているのが分かります / 出典: Carl Lender, derivative work: Atlantictire / CC BY 2.0 via Wikimedia Commons

頂点はロジャー・トラウトマンです。バンドZapp(ザップ)で彼はトークボックスを添え物のエフェクトではなく、メインボーカルとして使いました。エレクトロ・ハーモニックスのGolden Throatを改造し、ギターの代わりにミニモーグを、のちにヤマハDX100をつないで音程を作りました。2Pacの1995年「California Love」のフックが彼のトークボックスです。

▶ 2Pac ft. Dr. Dre & Roger Troutman - California Love

一方は研究所で、もう一方はステージで育ったわけです。だからボコーダーは精緻で概念的、トークボックスは荒っぽくて身体的なのです。

⑦ 今、家で試すなら

🔹 ボコーダーはほぼ敷居がありません

最近のDAWにはたいていボコーダーが標準で入っています。使い方はどの製品でも同じです。トラックを2本用意します。ひとつはマイクで録ったしゃべり声(モジュレーター)、もうひとつはシンセの音(キャリア)。ボコーダープラグインにこの2本をそれぞれつなぐだけです。

ここで初心者がいちばん詰まるのがキャリア選びです。倍音の乏しい音をキャリアにすると、ことばが聞こえません。 サイン波のように倍音がほとんどない音は、ボコーダーが削る材料そのものがないからです。ノコギリ波やパルスのように倍音がぎっしり詰まった音を使ってください。ここにホワイトノイズをほんの少し混ぜると子音が立ちます。音がこもるならバンド数を増やし、人間っぽすぎるなら減らせばいいだけです。

Korg VC-10 — 1978年の単体ボコーダー。マイクが本体に直付けされています

Korg VC-10 — 1978年の単体ボコーダー。マイクが本体に直付けされています / 出典: Michael Calore / CC BY 2.0 via Wikimedia Commons

🔹 トークボックスは実機が要ります

プラグインのトークボックスもありますが、多くはボコーダー系のアルゴリズムで似せたものです。あのぬめった質感の半分は本物の口の中の空間から出ているので、ソフトウェアで完全に置き換わることはありません。実機を使うならアンプのラインを別に引く必要がありますし、チューブをくわえる覚悟もいります。音量は少しずつ上げていくのがいいです。最初から大きく上げると歯が響いて耳が痛くなります。

数値やプリセットより大事なのは、はっきりしゃべる習慣です。どちらの機械も口の形の情報だけを受け取って使うからです。普段より大げさに口を開け、子音を強めに発音すると結果が目に見えて変わります。機材を替える前に発音を替えてみることをおすすめします。

⑧ ダフト・パンクは何を使っていたのか

いちばん多く聞かれる質問なので、項目を分けて書いておきます。結論から言うと、ひとつに断定はできません。

2001年5月の『Remix』のインタビューで、2人は曲ごとに機材を変えていたと語っています。古いローランドSVC-350ボコーダー、オートチューン、デジテックのVocalistを状況に応じて選び、なかでもDigiTech Talkerを特に気に入っていたそうです。複数の道具を重ねた結果だという意味です。

ネット上には「この曲はトークボックス、あの曲はこれ」といった断定的なリストが出回っていますが、そのほとんどはファンコミュニティで推測が固まった話にすぎません。本人たちが曲ごとに確認した資料はほとんど残っていない。ですから「ダフト・パンクの音」をひとつの機械で再現しようとするアプローチ自体がずれているわけです。彼ら自身が混ぜていたのですから。

▶ Daft Punk - Around the World — この声ひとつにも複数の道具が重なっています

💡 要するに — ロボットボイスは機材の名前ではなく、方式の名前です。回路が削ったのか、口が削ったのか。この2つを区別して聴きはじめると、以前は一緒くたに聞こえていた曲が分かれて聞こえてきます。

🙋 よくある質問

Q. ボコーダーで歌えばいいんですか?

音程は鍵盤が決めるので、歌うように発声する必要はありません。しゃべるようにはっきり発音するほうがいいです。むしろ歌うようにすると口の形がぼやけて、歌詞が聞き取りにくくなります。

Q. トークボックスはのどを痛めませんか?

声帯を使わないので、のど自体への負担は少ないです。問題は別のところにあります。音量が大きいと頭蓋骨に振動がそのまま伝わって、歯と耳がきつくなります。チューブの衛生管理も必要です。

Q. オートチューンのロボットボイスはまた別物ですか?

別物です。オートチューンは人の声をそのまま残して、音程だけを階段状に強制的に押し込んだ結果です。声そのものは生きています。ボコーダーとトークボックスは声を材料としてだけ使うか、通り道としてだけ使う方式なので、そもそも層が違います。

Q. どちらから先に覚えるべきですか?

ボコーダーです。すでにDAWの中に入っていますし、今日トラックを2本作るだけで音が出ます。トークボックスは実機とアンプラインが要るので、あとで考えても間に合います。

Q. バンド数はいくつが適当ですか?

正解はありません。少ないとつぶれる代わりに機械っぽさが強くなり、多いとはっきりする代わりに平坦になります。クラフトワークのあの質感が欲しいなら、むしろ少ないほうが近いです。数字を覚えるのではなく、両端まで回してみて耳で場所を見つけてください。

📌 一行でまとめ

ボコーダーは回路が声から骨格だけを盗んでシンセに被せる機械、トークボックスはギターの音を口に押し込んで本物の口で削る装置です。計算か物理か — この違いが2つの音の質感をすべて決めています。

好きな曲のなかに「これはボコーダーだろうかトークボックスだろうか」と迷うものがあれば、コメントで教えてください。一緒に聴いてみると面白そうです。

#ボコーダー #トークボックス #ロボットボイス #シンセサイザー #音楽機材の歴史 #クラフトワーク #ピーターフランプトン #ロジャートラウトマン #宅録 #DTM

記事が役に立ったら、クリックで応援してもらえると励みになります

にほんブログ村 音楽ブログ DTM・MIDIへ

Mixloom - にほんブログ村

20年経っても古びないビート — ティンバランドの音の正体



2000年代初頭のポップやR&Bを聴いていると、妙に耳に引っかかる曲があります。ハイハットが言葉に詰まるようにタタタッと転がり、どこからか赤ちゃんの声のような音が拍を刻み、アメリカのポップなのにインド音楽のような色が敷かれている。

初めて聴いたときは「これは何の音だ」と思い、20年経った今聴いても古びた感じがしません。

その多くが一人の手から出ています。プロデューサーのティンバランドです。今日はその音が何でできているのかを分解していきます。

① ティンバランドとは誰か 👤

本名はティモシー・モズリー。1972年、アメリカのバージニア州ノーフォーク出身です。

地元の友人ミッシー・エリオットと一緒に始め、1996年のジヌワイン「Pony」で名前が知られるようになりました。その後はアリーヤ、ジャスティン・ティンバーレイク、ネリー・ファータド、ジェイ・Z、マドンナまで、ジャンルを問わずヒット曲を出し続けます。

ただ、彼の曲には変わった点があります。誰が作ったのかが数秒でわかるのです。プロデューサーとしては珍しいことでしょう。ほとんどのプロデューサーはアーティストに合わせて色を変えますから。

その署名のような音が何でできているのか、一つずつ見ていきます。

② 材料1 — 言葉に詰まるハイハット 🥁

いちばん気づきやすい特徴です。

🔹 ふつうのハイハット

一定の間隔で「チ・チ・チ・チ」と刻まれます。時計のように規則的で、曲の拍を案内する役割ですね。

🔹 ティンバランドのハイハット

16分音符、32分音符でさらに細かく割ったうえで、拍の頭ではない場所に集めます。拍を案内する代わりに、拍と拍のあいだを縫って走るわけです。

ここで用語をひとつ。拍の頭ではなく、その間の裏拍に音を置いてリズムに引っかかりを作ることをシンコペーションといいます。ティンバランドはこれをハイハットに集中的に使います。

🔹 それでどう聞こえるか

ハイハットが機械的に流れず、言葉に詰まるようにタタタッと転がります。そしてこの不規則な動きが、曲全体に運動感を生みます。

📌 真似をするなら

16分のハイハットを敷いてから、拍の頭に来るものを消すか、うんと弱くしてみてください。裏拍だけが残って転がる感じが出ます。そこにいくつかを32分に割って入れると、あの「詰まる」質感になります。

③ 材料2 — 口で作った打楽器 👄

ティンバランドは楽器の音だけを使いません。自分の口で出したビートボックス、息の音、さらには赤ちゃんの声までサンプリングして、打楽器のように配置します。

いちばん有名な例が1998年、アリーヤの「Are You That Somebody」です。サビの合間に聞こえる赤ちゃんの声、あれが実際のサンプルです。

当時としては型破りでした。ドラムマシンと生楽器の録音が素材のすべてだった時代に、音であれば何でも素材になるという発想を、ポップスの真ん中で実行したわけです。

▶ Aaliyah & Timbaland - Are You That Somebody? (Official Performance Video)

🔹 なぜこれが効くのか

人の口から出た音は、ドラムマシンの音とは質感がまるで違います。規格から外れていて、毎回少しずつ違い、何より人間だとすぐに伝わります。機械的なビートの上にこういう音が一つ乗るだけで、曲が急に生きているように聞こえるのです。

今では珍しくない手法になりましたが、今でも有効な方法でもあります。マイクが一本あれば誰でもできますし。

④ 材料3 — 見知らぬ場所から持ってきた色 🌏

ティンバランド・サウンドの色を決めているのは、それまで西洋のポップスで鳴っていなかった素材です。

2001年、ミッシー・エリオットの「Get Ur Freak On」が代表例です。インドのパンジャーブ地方のバングラのリズムを、ポップスのど真ん中に持ち込みました。当時のアメリカのチャートで、こういう音は鳴っていませんでした。

▶ Missy Elliott - Get Ur Freak On [Official Music Video]

🔹 なぜこれが通用したのか

珍しいだけでは通用しません。彼がやったのは、見慣れない素材を、聞き慣れた構造の中に入れることでした。曲の骨格はヒップホップとR&Bの文法のままで、その上に誰も使っていなかった色を乗せる。すると、新しいのに難しくない音ができあがります。

📌 ただし順風満帆ではありませんでした

サンプリングは常に権利の問題を連れてきます。2000年、ジェイ・Zの「Big Pimpin'」がその例です。なお以下は公開された判決と報道をまとめたもので、私は弁護士ではないため法律上の助言ではありません。

この曲は、エジプトの作曲家バリーグ・ハムディが1957年に書き、アブドゥル・ハリーム・ハーフェズが歌った曲の一部をサンプリングしています。ティンバランド側は当初、この曲の著作権が消滅していると考えていました。実際はそうではなく、権利者が権利を主張したため、10万ドルを支払って使用許諾を得ることになります。

話はここで終わりません。2007年、作曲家の遺族が別途訴訟を起こしたのです。争点は独特でした。金を払ったかどうかではなく、原曲を切り取って繰り返し使ったことが作曲家の人格的な権利を侵害したのかという点でした。

この権利はエジプトの法律にはありますが、アメリカの著作権法の体系とは異なります。結果として2015年の裁判でジェイ・Zとティンバランド側が勝ち、2018年の控訴審でも同じ結論が維持されました。エジプト法上の人格権をアメリカの法廷で執行することはできないという趣旨です。

サンプリングが創作であると同時に、常に権利の問題と隣り合わせであることを示す事例です。そして「古い曲だから大丈夫だろう」という判断がどれだけ危ういかも。

⑤ 本当の武器は「空けること」 🕳️

ここまでの三つは、何を足したかの話でした。ところがティンバランド・サウンドにおいて、もしかするともっと決定的なのは、何を引いたかのほうです。

🔹 彼のトラックはたいてい空いています

同時期の他のポップスのプロデューサーがトラックを何層にも重ねていたころ、彼はむしろ削っていました。区間によっては、ドラムとベース、そして声しかありません。

🔹 なぜこれが強くなるのか

音が少なければ、残った音がそれぞれ広い場所を取れます。互いに隠し合うことがないので一つひとつがくっきり聞こえ、低音はより大きく感じられます。

そして空白があると、そこに入ってくる音が「事件」になります。ずっと何かが鳴っていれば新しく入った音もその中の一つでしかありませんが、静かなところに入ってくれば耳がそちらに向きます。さきほどの赤ちゃんの声や見慣れないサンプルが強い印象を残したのも、周りが空いていたからです。

🔹 なぜ古びないのか

ここが核心です。流行はたいてい埋め方のほうに現れます。どのシンセが流行り、どのリバーブが流行ったかが時代を映すわけです。だから派手に埋めた曲ほど、時間が経つと年代が見えてきます。

ところが空いているトラックには、時代を映す要素そのものが少ない。20年経った彼の曲が今聴いても古びた感じがしにくいのは、そのためです。

📌 実践に移すと

曲が窮屈なとき、何かを足す前に、ある区間でトラックを二つ落としてみてください。何がなくても曲が成立するのかを確かめるのです。たいてい一つくらいは無くてもいいものがあり、それを抜くと残りが生きてきます。

⑥ 機材は決定的ではなかった 🎛️

ティンバランドが当時おもに使っていたのは、90年代のサンプラー1台でした。今の基準ではスペックはお粗末で、メモリーも小さく、画面も手のひらほどです。

それなのに、その機械で作った音が今も古びていません。

🔹 ここから得られること

音を決めたのは機械ではなく、何を入れて何を抜くかという判断だったということです。彼がやったことの中に、今の機材でできないものは一つもありません。ハイハットを裏拍に置くことも、口で音を出して録ることも、トラックを空けることも。

むしろ今のほうがずっと簡単です。それでもあの音が当たり前になっていないのは、それが機材の問題ではなかったという証拠でしょう。

⑦ Q&A 💬

Q. ティンバランド風を今やってもいいのでしょうか。

A. 特定の曲の素材をそのまま持ってくるのは別の話ですが、方法論はいくらでも使えます。裏拍のハイハット、口で作った打楽器、思い切った空白。この三つはジャンルを問わず通用します。

Q. 口で出した音はどう加工しますか。

A. 録ってからごく短く切るのが先です。そのあとハイパスで低域を掃除し、必要なら音程を上げ下げして元の正体をぼかします。声だとバレると面白くないし、まったくわからないと人の匂いが消えるので、その中間を探すのがコツです。

Q. トラックを空けると物足りなくなりませんか。

A. 最初は物足りなく感じます。ただそれは慣れの問題であることが多いです。一人で聴くと寂しくても、他の曲と混ざって再生されるときはむしろ目立ちます。それに空ければ残りの音を大きくできるので、結果として曲が大きく聞こえます。

Q. 見慣れない素材はどこで見つけますか。

A. ふだん自分が聴かない音楽を聴くのがいちばん早いです。他の国の伝統音楽、他の時代の音楽、他のジャンル。ただしそのまま持ってくると権利の問題がついてくるので、音をそのまま使うより、リズムや音階といった構造を借りるほうが安全ですし、創作としても良い結果になります。

Q. 彼の曲は低音がやけに大きく聞こえるのですが。

A. 低音そのものを上げたというより、周りを空けた効果が大きいです。中域に音が少なければ低音が相対的に際立ちますから。低音を大きくしたいときに低音を上げるのではなく、他のトラックの中低域を削るという発想は、ここから来ています。

Q. 今も活動しているのですか。

A. 活動は続いています。ただ今日の話の核心は、現在の活動よりも2000年代初頭に作られた方法論が今でも有効であるという点です。当時の彼が耳新しく聞こえた理由が、今の私たちが当たり前だと思っていることの出発点になっている場合が少なくありません。

おわりに

今日の内容を一行にまとめるとこうなります。

「ティンバランド・サウンドの正体は特別な音ではなく、思い切った空白である — 流行は埋め方に現れ、空いているものは古びにくい」

みなさんは曲が窮屈なとき、まず何をしますか。コメントで教えてください。

#ティンバランド #音楽制作 #ビートメイキング #サンプリング #ヒップホップ #DTM #ミックス #編曲 #作曲 #宅録

石油を探すアルゴリズムが声を直すまで — オートチューンはどう作られたか



オートチューンを作った人は音楽家ではありませんでした。正確には音楽家でもあったのですが、本業は地中から石油を探す仕事だったのです。

そして彼がオートチューンを作るのに使った技術は、音楽のために開発されたものではありません。地下数千メートルの地層構造を読み取るために作られた数学でした。

今日はその技術がどうやって人の声へ渡ってきたのか、そしてそれがなぜあれほど難しい仕事だったのかを追いかけます。

① フルートを吹く石油エンジニア 🎺

アンディ・ヒルデブランド。 地球物理学のエンジニアであり、数学者です。

彼はエクソンの研究部門で働き、その後ランドマーク・グラフィックスという会社を共同で立ち上げます。仕事は、信号処理の技術で地下の石油の位置を突き止めること。この会社はのちに大手の油田サービス企業に買収されます。業界では成功したほうのキャリアでしょう。

ところが彼にはもう一つの顔がありました。フルート奏者だったのです。16歳ですでにプロとしての演奏活動を始めていたほど、本格的な水準でした。

そして1989年、彼は石油業界を去ります。そして大学の音楽学校に入り、作曲を学び始めます。すでに地位を築いたエンジニアが、40歳前後で音楽の勉強を始めたわけです。

ここからが面白いところです。彼は音楽を学びながらもエンジニアの手を離しませんでした。1990年に会社を一つ作り、音を扱うソフトウェアを世に出します。この会社がのちにオートチューンを送り出すことになります。

② 地中を読む数学 — 自己相関 🌍

彼が石油業界で扱っていた技術が、そのままオートチューンの核心になります。ですからこれが何なのかを押さえておく必要があります。

🔹 石油はどうやって探すのか

地中に向けて振動を打ち込みます。その振動は地層の境目で反射して戻ってきて、地表に並べたセンサーが受け取ります。

問題は、戻ってきた信号がひどく汚れていることです。あらゆる雑音が混じり、いくつもの層で反射した信号が重なっています。その中から意味のある繰り返しのパターンを見つけ出さないと、地層の構造はわかりません。

🔹 自己相関という方法

ここで使うのが自己相関(autocorrelation)です。原理は意外なほど単純です。

信号をコピーして、少しずつずらしながら元の信号と重ねてみる。 そして、どれだけずらしたときにいちばんよく重なるかを見ます。

よく重なるということは、そのずらし幅の分だけ信号が繰り返しているという意味です。つまりどれだけずらすといちばん重なるかを見つければ、その信号に隠れている周期がわかるわけです。

🔹 そして声もまた周期信号です

ここが接点になります。

人が声を出すと声帯が振動します。その振動は一定の周期で繰り返され、その周期こそが音程です。1秒間に440回繰り返せば440Hz、私たちが「ラ」と呼ぶ音ですね。

つまり地層の中から繰り返しを探していた方法で、声の中から音程を探せるのです。対象が変わっただけで、やっていることは同じです。

③ 昼食の席での冗談 🍽️

技術はありましたが、それを声に使おうという発想は別のところから来ました。

1995年ごろ、業界の人たちとの昼食の席で、ある人が彼にこう冗談を言ったそうです。「音程を合わせて歌えるようにする箱でも作ってくださいよ」

冗談でしたが、彼は真に受けました。自分が十数年扱ってきた技術が、まさにその仕事をできると知っていたからです。

そして数か月後の1996年末、オートチューンが形になります。

📌 話が少し簡単に見えますが

実際はそうではありませんでした。次の二つの項目が、なぜ難しかったのかを示しています。アイデアが出たあとにも解くべき問題が二つ残っていたのです。一つは精度、もう一つは速度でした。

④ 音程を読み取るのはなぜ難しいのか 🗣️

当時も音程を読み取ろうという試みはありました。主に使われていたのは音の中から特徴的な地点を見つけて、それで判断する方法です。波形の中でいちばん高い山を探すとか、ゼロを横切る回数を数えるといったやり方ですね。

この方法は単純な音ではうまくいきます。問題は、人の声が単純ではないことです。

🔹 二重母音という落とし穴

人が歌うとき、母音は絶えず変化します。とくに一つの音の中で母音が変わる場合があります。「あい」「おう」のように二つの母音が続く音を二重母音といいますが、歌ではこれが一つの音の内側で起こるのです。

すると音の形が途中でがらりと変わります。特徴的な地点を探して判断する方法は、ここで崩れます。音程は同じなのに形が変わったので、別の音として読んでしまうのです。

そうなるとどうなるか。補正器が急に見当違いの音へ引っ張ります。音が「ブツッ」と跳ねたり、変な雑音が混じったりするわけです。

🔹 自己相関が有利な理由

自己相関は特徴的な一点を見ません。信号全体をまるごと自分自身と比べます。だから形が途中で多少変わっても、全体としての繰り返しの周期は依然として見つけられます。

この違いが決定的でした。オートチューンがそれまでの試みより安定して動いた理由がここにあります。

⑤ 100万回を4回に ⚡

精度の問題を解決すると、次の問題が現れます。遅すぎたのです。

自己相関は信号をずらし続けながら、毎回かけて足す計算です。ずらせる位置は数千通りあり、音は1秒間に数万回測定されるので、計算量が途方もないことになります。当時のコンピューターでは実時間処理が不可能な水準でした。

ここで彼の数学のキャリアが再び登場します。彼は計算そのものを減らす方法を見つけ出しました。本人の表現を借りれば、100万回の計算を4回に減らす単純化だったといいます。

🔹 なぜこれが重要なのか

計算が速くなったということは、リアルタイムで動かせるようになったという意味です。録っておいたファイルをあとから処理するのと、歌っているあいだにその場で直すのとは、まるで別物です。

そしてこの点こそ、オートチューンが単なる補正ツールを超えた理由でもあります。リアルタイムで動くから歌いながら結果が聞こえ、そうなるとその音を前提にして歌うようになる。道具が演奏のしかたを変え始めたわけです。

⑥ 1997年、人々が手からもぎ取っていった 📦

オートチューンは1997年、楽器業界の見本市で初めて公開され、その年の9月に正式に発売されます。

作った本人は、そこまで売れるとは思っていなかったそうです。ところが見本市での反応は予想外でした。人々が彼の手からコピーを奪い取るようにして持っていったという話が残っています。

理由ははっきりしています。それまで音程の外れたテイクを直すには、歌い直すしかなかったのです。歌手をもう一度呼び、スタジオをもう一度借り、時間をもう一度使う。その費用を知っている人たちの前に「これで直せます」という物が現れたわけです。

🔹 彼が作ろうとしたもの

当時の彼の目標は明確でした。それとわからない静かな道具。わずかに外れた音程を誰にも気づかれずに直す、裏方の機材を作ろうとしていたのです。

ところがその中には、彼が「誰も使わないだろう」と思っていた設定が一つありました。音程を引き寄せる速度をいちばん速くする値です。そう設定すると、声が階段を踏むようにカクカクと張りついて、人の声らしくなくなります。補正の道具としては失敗した結果ですから。

その設定がどうなったかは、みなさんご存じのとおりです。道具を作った人が定めた用途と、世の中がそれを使うやり方は別物だということを、これほどよく示す例もなかなかありません。

🔹 そして2023年

彼はオートチューンで技術部門のグラミー賞を受賞します。石油を探していたアルゴリズムがポピュラー音楽の音を変えた功績を、音楽産業が公式に認めたわけです。

⑦ ここから残るもの 💡

この話が面白いのは、意外な展開だからというだけではありません。いくつかの条件が重なって初めて成立したことなのです。

🔹 二つの分野を両方知っていた

石油探査の技術だけを知っていたら、このアイデアは思いつかなかったでしょう。音楽だけを知っていたら自己相関を知らなかったはずです。両方を知っている人が少なく、だから誰もその接続を見つけられなかったのです。

🔹 問題を別の形に置き換えた

「声の音程をどう突き止めるか」という問題を、「この信号の繰り返しの周期はいくつか」という問題に置き換えました。その瞬間、すでに答えを知っている問題になったわけです。難しい問題を解くより、すでに解かれた問題に置き換えるほうが速いことがあります。

🔹 冗談を聞き流さなかった

昼食の席の冗談が始まりでした。ほとんどの人は笑って流したことでしょう。

⑧ Q&A 💬

Q. 自己相関は今も使われていますか。

A. 使われています。音程を検出する複数の方法の一つとして広く使われていますし、自己相関を改良した派生型もたくさんあります。ただ最近は周波数成分を解析する方式や、複数の方法を組み合わせるケースも増えています。

Q. 声以外の楽器の音程も読み取れますか。

A. 原理上は可能です。ただ難しい場合があります。複数の音が同時に鳴っている音が代表例です。ギターでコードを弾くと複数の周期が重なっているので、一つを取り出すのがずっと難しくなります。これを扱う技術は別途発展してきて、今ではかなりの水準に達しています。

Q. なぜよりによって石油探査の技術だったのですか。

A. 偶然というより必然に近いです。地下探査は汚れた信号の中から隠れた構造を見つけ出す仕事であり、そのため信号処理の技術がとても早い段階から精緻に発展した分野でした。大きな資本が投じられる産業なので研究も活発でしたし。音楽の側より先を行っていた技術が渡ってきたわけです。

Q. オートチューン以前は本当に方法がなかったのですか。

A. テープの速度を変えて音程をずらす方法はありましたが、速度を変えると長さも一緒に変わり、声の質感も変わってしまいます。特定の一音だけを選んで直すのは事実上不可能でした。だから歌い直すのが唯一の答えだったのです。

Q. 発明した本人は今の状況をどう見ているのでしょうか。

A. 彼はいくつかのインタビューで、自分の道具の使われ方について比較的淡々とした態度を見せてきました。作ったときに意図しなかった用途で使われていることを認めつつ、それを問題視するより現象として受け止める姿勢に近いです。

Q. こんなふうに他分野の技術が音楽に来た例は他にもありますか。

A. かなりあります。音声通信のために開発された技術が楽器になった例、軍用の通信機材から出発した技術が音楽に使われた例などです。音楽技術のかなりの部分が、もともと別の目的で作られたものの転用です。音楽市場は研究開発費を賄うには小さすぎましたから。

おわりに

今日の内容を一行にまとめるとこうなります。

「難しい問題を解くより、すでに答えのある問題に置き換えるほうが速いことがある — 声の音程を問う代わりに信号の周期を問うたのがオートチューンだった」

みなさんは他の分野から持ってきた発想で問題を解いた経験はありますか。コメントで教えてください。

#オートチューン #ピッチ補正 #音楽制作 #信号処理 #音楽史 #DTM #ボーカル #ミックス #宅録 #シンセ