ベストプラクティス

ElevenCreativeでMusicのプロンプト作成を習得し、最大限の音楽性とコントロールを実現しましょう。

このガイドでは、ElevenCreativeで音楽をプロンプトするための最も効果的なテクニックをまとめています。モデルがプロンプトをどう読み取るか、制作ボキャブラリー、音楽的なコントロール、アレンジ、ボーカル、ループ、サウンドデザイン、構成のタイミングと歌詞を取り上げます。

モデルは意図を理解し、目標に基づいて文脈を考慮した完全なオーディオを生成するよう設計されています。_“スニーカーブランドの広告”や”ボイスオーバー付きの穏やかな瞑想”_のような大まかなプロンプトでも、ユースケースに合ったトーン、構成、コンテンツへモデルを導くには十分なことが多いです。

モデルによるプロンプトの読み取り方

プロンプトは、意図しているかどうかにかかわらず、ジャンル、ムード、楽器編成、テンポ、制作時代という5つの質問に答えています。指定しなかった項目は、モデルが統計的に最も可能性の高い選択、つまり最も平均的な選択で補います。

5つすべてを指定しないプロンプト:

upbeat electronic track

5つすべてを指定した同じリクエスト:

French house, 122 BPM, filtered disco sample chops, sidechained bass, tight
four-on-the-floor kick, rooftop-at-sunset mood, warm analog glue

2つ目のプロンプトに特別なテクニックはありません。出力に含まれるすべての決定は、人が下したものです。モデルに決められる前に、ジャンル、ムード、楽器、テンポ、時代を決めましょう。

ジャンルと創造性

モデルは、ジャンルの慣習や感情的なトーンに高い精度で従います。次の両方に効果的に反応します。

  • 抽象的なムードの表現(例:「不気味な」「不吉な」)
  • 詳細な音楽用語(例:「脈打つサブベースの上で鳴る不協和なバイオリンの金切り音」)

プロンプトの長さや詳細さが、常により高品質な出力につながるとは限りません。よりクリエイティブで意外性のある結果を得るには、シンプルで印象的なキーワードを使い、モデルに自由に解釈・作曲させてみてください。

制作ボキャブラリー

モデルは、スタジオで語られるのと同じように音楽を理解します。スタジオ用語は実際の調整を行います。sidechained、close-mic’d、bone-dry、tape saturation、_plate reverb_は、それぞれミックスを聴いてわかるほど変化させます。

同じバラードを3つの部屋で演奏する場合でも、変わるのは制作に関する言葉だけです。

slow soul ballad, 68 BPM, female vocal — bone-dry drums, close-mic'd vocal, dead room
slow soul ballad, 68 BPM, female vocal — cavernous plate reverb, tape echo throws, gospel room
slow soul ballad, 68 BPM, female vocal — tape saturation, wow and flutter, dusty vinyl crackle

ボキャブラリーがなくても、空間を説明してください。「階段の踊り場で録音したような音」と書けば、階段の踊り場らしい音になります。

制作時代はテンポと同じように調整できる要素で、モデルは曲の途中でも変えられます。時代を指定すると(「スラップバックエコーを効かせた1950年代のロックンロール」「1990年代のジャングル」など)、制作全体のキャラクターが決まります。時間の経過に沿って時代の変化を記述すれば、1曲の中で一貫したトランジションを作れます。

音楽的なコントロール

モデルはBPMを正確に守り、意図した調性も捉えることがよくあります。タイミングとハーモニーをより細かくコントロールするには、プロンプトに「130 BPM」のようなテンポ指定や、「Aマイナーで」のような調号を含めてください。モデルは、指定したBPMとキーを、ボーカルテイク、サンプル、2回目の生成など他の素材と出力を重ねられるほど正確に維持します。

ボーカルの歌い方やトーンに影響を与えるには、「生々しい」「ライブ感のある」「グリッチした」「息混じりの」「アグレッシブな」などの表現を使います。歌唱指示も同様に機能します。whispered、belted、conversational、deadpan、stacked harmonies。対照的な指示で同じ歌詞を使う例:

whispered indie folk, close and intimate, fingerpicked acoustic guitar
stadium rock, belted powerhouse vocal, huge drums, wall of guitars

モデルは複数のボーカリストも効果的に表現できます。ボーカルアレンジを指定するには、「Cでハーモニーを歌う2人のシンガー」のようなプロンプトを使ってください。

一般に、プロンプトを詳しくするほど、出力のコントロール性と表現力が高まります。

アレンジ

モデルは時間に関する指示に従います。バンドに指示を出すように、アレンジを順番に説明してください。

UK garage, 132 BPM — start with just a shuffled drum loop, add a warm sub bassline
after four bars, then bring in chopped vocal stabs for the drop

重要な役割を果たすのは小さな言葉です。start with、just、then、bring in。_just_がないと、モデルは無音を埋めてしまいます。無音にしたい部分は明確に指定してください。

ループ

ループのプロンプトは、要素を除外する練習です。小節数、BPM、キーを指定し、禁止するものも指定します。

boom bap drum break, 90 BPM, dusty and swung, four bars, no melody — just drums
dreamy guitar loop, 140 BPM, F sharp minor, emo trap, four bars, instrumental

「メロディなし、ドラムのみ」と指定することこそが、ドラムブレイクをドラムブレイクのまま保つ理由です。ループでは、余白がプロンプトになります。

構成のタイミングと歌詞

曲の長さを指定することも(例:「60秒」)、オートモードでモデルに長さを決めさせることもできます。歌詞を指定しない場合、モデルは選択または自動検出された長さに合う構造化された歌詞を生成します。

デフォルトでは、ほとんどの音楽プロンプトに歌詞が含まれます。ボーカルなしで音楽を生成するには、プロンプトに「instrumental only」を追加してください。よりクリエイティブにコントロールしたい場合は、自分で歌詞を書くこともできます。モデルは、歌詞とプロンプトの長さを組み合わせて、ボーカルの構成と配置を決めます。

ボーカルの開始または終了のタイミングを管理するには、次のような明確なタイミング指定を含めてください。

  • 「歌詞は15秒から始まる」
  • 「1:45以降はインストゥルメンタルのみ」

モデルは多言語での歌詞生成に対応しています。UIで生成した曲の言語を変更するには、「日本語にして」や「スペイン語に翻訳して」のようなフォローアップを使用してください。

楽器とボーカルの分離

より高いコントロールでステムを作成するには、対象を絞ったプロンプトと構成を使用してください。

  • 楽器の前に「solo」を付けます(例:「solo electric guitar」「solo piano in C minor」)。
  • ボーカルの場合は、ボーカルの説明の前に「a cappella」を付けます(例:「a cappella female vocals」「a cappella male chorus」)。

ステムの品質とコントロールを向上させるには:

  • キー、テンポ(BPM)、音楽的なトーンを含めます(例:「a cappella vocals in A major, 90 BPM, soulful and raw」)。
  • モデルの出力を導くため、できるだけ音楽的に詳しく記述します。

サウンドデザイン

モデルは音そのものをレンダリングするため、説明している音が物理的に起こり得るかどうかは気にしません。音楽以外のオーディオ、つまりサウンドエフェクト、環境音、テクスチャは、直接プロンプトすることも、トラックに組み込むこともできます。

a thunderstorm in 6/8 — thunder lands on the downbeat, rain fills the offbeats,
distant lightning as crash cymbals
one enormous cathedral bell that, as it decays, slowly turns out to have been
a choir all along
an orchestra tuning up that accidentally becomes techno — the A gets a kick drum,
chaos becomes a groove

方法はこうです。実在する音を取り、それが持つはずのない性質を1つ与え、平然と結果を説明します。このガイドにあるすべてのテクニック、つまりキー、BPM、サイドチェイン、アレンジの記述は、こうした音を素材として扱う際にも使えます。

オーディオリファレンス

説明しにくいアイデアもあります。スマートフォンにハミングで録音したメロディ、特定のベースラインだけが持つスイング、指し示すことしかできないテクスチャなどです。トラック(ボイスメモでも可)をオーディオリファレンスとしてアップロードすると、モデルはノートをコピーせずに、その雰囲気、グルーヴ、音色のパレットを再現します。

プロンプトは、リファレンスで指定されていないすべての要素を引き続き導きます。効果的な組み合わせは、雰囲気を担うリファレンスと、何を変えるべきかを伝えるプロンプトです。たとえば「同じエネルギー、ハーフタイムのドラム、女性ボーカル」のように指定します。

アップロードは約30秒まで可能です。すべてのリファレンストラックは生成前に著作権チェックを通過します。オーディオリファレンスは、自分で作った音楽のために設計されています。

プロンプト例

モデルを使えば、曲の説明を超えて意図まで伝え、創造性を最大限に引き出せます。

Track for a high-end mascara commercial. Upbeat and polished. Voiceover only.
The script begins: "We bring you the most volumizing mascara yet." Mention the brand
name "X" at the end.

まとめ

このガイドの大半は、次の3つの習慣でカバーできます。

  1. 具体的に指定する。 ジャンル、ムード、楽器、テンポ、時代の5つをすべて決めましょう。決めなければ、モデルが決めます。
  2. 制作の言葉で話す。 スタジオ用語は実際の調整を行い、モデルは数値を正確に守ります。
  3. 重要な部分を制約し、それ以外には余地を残す。 アレンジの記述、明確な除外指定、ボイスへの指示を活用しましょう。

高度な機能:コンポジションプラン

セクション構成、歌詞の配置、複数ボーカリストのアレンジを正確にコントロールするには、シンプルなテキストプロンプトではなくコンポジションプランを使用してください。