VoAI ConnectAPI
讓文字
擁有聲音
台灣口音、情感自然的中文語音合成。從單句朗讀、多角色對話, 到會說話的虛擬人影像,全部用同一把 API Key 串接。
3
語音模型
1000
單次字數上限
3
輸出格式
120s
虛擬人音檔上限
能做什麼
文字轉語音
把一段文字變成自然的語音。支援停頓標籤、語速與音調微調,
也能用 streaming 邊生成邊播。
多角色對話
一次請求合成整段多人對話,系統自動依序串接成單一音檔。
適合劇情演出、訪談模擬、廣播劇。
虛擬人影像
給一張照片與一段音檔,生成會說話的虛擬人影片。
非同步處理,建立後輪詢狀態即可。
配音員與模型
查詢可用的配音員、風格與模型版本。
串接前先確認組合,可以省掉大量參數錯誤。
帳務與額度
查詢剩餘點數與金鑰效期,理解各模型的計費方式與併發上限。
一分鐘試一次
把 your-api-key 換成你的金鑰,直接貼進終端機:
curl --location '{{BASE_URL}}/TTS/Speech' \
--header 'x-api-key: your-api-key' \
--header 'x-output-format: wav' \
--header 'Content-Type: application/json' \
--data '{
"version": "Sota+",
"text": "VoAI 絕好聲創的聲音,符合臺灣口音,又自然流暢。",
"speaker": "佑希",
"style": "聊天",
"speed": 1,
"pitch_shift": 0,
"style_weight": 0.5,
"breath_pause": 0
}' \
--output output.wav
import requests
resp = requests.post(
"{{BASE_URL}}/TTS/Speech",
headers={"x-api-key": "your-api-key", "x-output-format": "wav"},
json={
"version": "Sota+",
"text": "VoAI 絕好聲創的聲音,符合臺灣口音,又自然流暢。",
"speaker": "佑希",
"style": "聊天",
},
timeout=120,
)
resp.raise_for_status()
with open("output.wav", "wb") as f:
f.write(resp.content)
三種模型
在速度、情感表現與價格之間各有取捨:
| 版本 | 特性 | 適用場景 | 計費 |
|---|---|---|---|
Classic |
極速生成、穩定性高,長文本無壓力 | 日常辦公、內容創作 | 1 字 1 點 |
Neo |
情感層次細膩、語調自然流暢 | 短影音、故事朗讀 | 1 字 1 點 |
Sota+ |
最新生成式技術,擬真度與表現力最高 | 高品質語音需求 | 1 字 1 點 |
共通規則
驗證
所有請求都要在 header 帶上 x-api-key。金鑰由 VoAI 依合約發放,
對應一個帳號的額度與併發上限,請勿放在前端程式碼中。
錯誤格式
非 2xx 的回應一律是 JSON,格式固定為 { "msg": "錯誤說明" }。
其中 529 代表併發已達上限,不是伺服器故障,建議用指數退避重試。
採樣率上限依模型而異。
Neo 最高 32000、Sota+ 最高 24000,超過會回傳 400。
未指定時系統會自動選擇該模型的預設值。