v1

latestOpenAPI 3.1.02026-07-17463886.3 KB
音声合成

2種類のスタイルでモーフィングした音声を合成する

指定された 2 種類のスタイルで音声を合成、指定した割合でモーフィングした音声を得ます。<br> モーフィングの割合は morph_rate で指定でき、0.0 でベースのスタイル、1.0 でターゲットのスタイルに近づきます。<br> AivisSpeech Engine では話者ごとに発声タイミングが異なる関係で実装不可能なため (動作こそするが聴くに耐えない) 、 常に 400 Bad Request を返します。

post/synthesis_morphing

Query parameters

base_speakerinteger required
target_speakerinteger required
morph_ratenumber required
enable_interrogative_upspeakboolean

AivisSpeech Engine ではサポートされていないパラメータです (常に無視されます) 。

AivisSpeech Engine ではサポートされていないパラメータです (常に無視されます) 。

core_versionstring

AivisSpeech Engine ではサポートされていないパラメータです (常に無視されます) 。

AivisSpeech Engine ではサポートされていないパラメータです (常に無視されます) 。

Request body

speedScalenumber required

全体の話速を 0.5 ~ 2.0 の範囲で指定する (デフォルト: 1.0) 。 2.0 で 2 倍速、0.5 で 0.5 倍速になる。

intonationScalenumber required

選択した話者スタイルの感情表現の強弱を 0.0 ~ 2.0 の範囲で指定する (デフォルト: 1.0) 。 「全体の抑揚」ではない点で VOICEVOX ENGINE と仕様が異なる。 数値が大きいほど、選択した話者スタイルに近い感情表現が込められた声になる。 例えば話者スタイルが「上機嫌」なら、数値が大きいほどより嬉しそうな明るい話し方になる。 一方で、話者やスタイルによっては、数値を上げすぎると発声がおかしくなったり、棒読みで不自然な声になる場合もある。 正しく発声できる上限値は話者やスタイルごとに異なる。必要に応じて最適な値を見つけて調整すること。 全スタイルの平均であるノーマルスタイルでは自動で適切な感情表現が選択されるため、この値を指定しても無視される。

tempoDynamicsScalenumber

話す速さ(テンポ)の緩急の強弱を 0.0 ~ 2.0 の範囲で指定する (デフォルト: 1.0) 。 AivisSpeech Engine 固有のフィールドで、VOICEVOX ENGINE には存在しない。 数値が大きいほどより早口で生っぽい抑揚がついた声になる。 VOICEVOX ENGINE との互換性のため、未指定時はデフォルト値が適用される。

pitchScalenumber required

全体の音高を -0.15 ~ 0.15 の範囲で指定する (デフォルト: 0.0) 。 数値が大きいほど高い声になる。 VOICEVOX ENGINE と異なり、この値を 0.0 から変更すると音質が劣化するため注意が必要。

volumeScalenumber required

全体の音量を 0.0 ~ 2.0 の範囲で指定する (デフォルト: 1.0) 。 数値が大きいほど大きな声になる。

prePhonemeLengthnumber required

音声の前の無音時間 (秒)。

postPhonemeLengthnumber required

音声の後の無音時間 (秒)。

pauseLengthnumber nullable

句読点などの無音時間。null のときは無視される。デフォルト値は null 。

pauseLengthScalenumber

句読点などの無音時間(倍率)。デフォルト値は 1 。

outputSamplingRateinteger required

音声データの出力サンプリングレート。

outputStereoboolean required

音声データをステレオ出力するか否か。

kanastring

読み上げるテキストを指定する。「読みの AquesTalk 風記法テキスト」ではない点で VOICEVOX ENGINE と仕様が異なる。 VOICEVOX ENGINE では AquesTalk 風記法テキストが入る読み取り専用フィールドだが (音声合成時には無視される) 、AivisSpeech Engine では音声合成時に漢字や記号が含まれた通常の読み上げテキストも必要なため、苦肉の策で読み上げテキスト指定用のフィールドとして転用した。 VOICEVOX ENGINE との互換性のため None や空文字列が指定された場合も動作するが、その場合はアクセント句から自動生成されたひらがな文字列が読み上げテキストになるため、不自然なイントネーションになってしまう。 可能な限り kana に通常の読み上げテキストを指定した上で音声合成 API に渡すことを推奨する。

Response

Successful Response