v1

latestOpenAPI 3.1.02026-07-17463886.3 KB
プリセット

新しいプリセットを追加する

新しいプリセットを追加します。

post/add_preset

Request body

idinteger required

プリセット ID 。

namestring required

プリセット名。

speaker_uuidstring required

キャラクターの UUID 。

style_idinteger required

スタイル ID 。

speedScalenumber required

全体の話速を 0.5 ~ 2.0 の範囲で指定する (デフォルト: 1.0) 。 2.0 で 2 倍速、0.5 で 0.5 倍速になる。

intonationScalenumber required

選択した話者スタイルの感情表現の強弱を 0.0 ~ 2.0 の範囲で指定する (デフォルト: 1.0) 。 「全体の抑揚」ではない点で VOICEVOX ENGINE と仕様が異なる。 数値が大きいほど、選択した話者スタイルに近い感情表現が込められた声になる。 例えば話者スタイルが「上機嫌」なら、数値が大きいほどより嬉しそうな明るい話し方になる。 一方で、話者やスタイルによっては、数値を上げすぎると発声がおかしくなったり、棒読みで不自然な声になる場合もある。 正しく発声できる上限値は話者やスタイルごとに異なる。必要に応じて最適な値を見つけて調整すること。 全スタイルの平均であるノーマルスタイルでは自動で適切な感情表現が選択されるため、この値を指定しても無視される。

tempoDynamicsScalenumber

話す速さ(テンポ)の緩急の強弱を 0.0 ~ 2.0 の範囲で指定する (デフォルト: 1.0) 。 AivisSpeech Engine 固有のフィールドで、VOICEVOX ENGINE には存在しない。 数値が大きいほどより早口で生っぽい抑揚がついた声になる。 VOICEVOX ENGINE との互換性のため、未指定時はデフォルト値が適用される。

pitchScalenumber required

全体の音高を -0.15 ~ 0.15 の範囲で指定する (デフォルト: 0.0) 。 数値が大きいほど高い声になる。 VOICEVOX ENGINE と異なり、この値を 0.0 から変更すると音質が劣化するため注意が必要。

volumeScalenumber required

全体の音量を 0.0 ~ 2.0 の範囲で指定する (デフォルト: 1.0) 。 数値が大きいほど大きな声になる。

prePhonemeLengthnumber required

音声の前の無音時間 (秒)。

postPhonemeLengthnumber required

音声の後の無音時間 (秒)。

pauseLengthnumber

句読点などの無音時間。null のときは無視される。デフォルト値は null 。

pauseLengthScalenumber

句読点などの無音時間(倍率)。デフォルト値は 1 。

Response

追加したプリセットのプリセットID

integer required