VoAI ConnectAPI

讓文字
擁有聲音

台灣口音、情感自然的中文語音合成。從單句朗讀、多角色對話, 到會說話的虛擬人影像,全部用同一把 API Key 串接。

3
語音模型
1000
單次字數上限
3
輸出格式
120s
虛擬人音檔上限

能做什麼

一分鐘試一次

your-api-key 換成你的金鑰,直接貼進終端機:

curl --location '{{BASE_URL}}/TTS/Speech' \
  --header 'x-api-key: your-api-key' \
  --header 'x-output-format: wav' \
  --header 'Content-Type: application/json' \
  --data '{
    "version": "Sota+",
    "text": "VoAI 絕好聲創的聲音,符合臺灣口音,又自然流暢。",
    "speaker": "佑希",
    "style": "聊天",
    "speed": 1,
    "pitch_shift": 0,
    "style_weight": 0.5,
    "breath_pause": 0
  }' \
  --output output.wav
                    
import requests

resp = requests.post(
    "{{BASE_URL}}/TTS/Speech",
    headers={"x-api-key": "your-api-key", "x-output-format": "wav"},
    json={
        "version": "Sota+",
        "text": "VoAI 絕好聲創的聲音,符合臺灣口音,又自然流暢。",
        "speaker": "佑希",
        "style": "聊天",
    },
    timeout=120,
)
resp.raise_for_status()

with open("output.wav", "wb") as f:
    f.write(resp.content)
                    

三種模型

在速度、情感表現與價格之間各有取捨:

版本特性適用場景計費
Classic 極速生成、穩定性高,長文本無壓力 日常辦公、內容創作 1 字 1 點
Neo 情感層次細膩、語調自然流暢 短影音、故事朗讀 1 字 1 點
Sota+ 最新生成式技術,擬真度與表現力最高 高品質語音需求 1 字 1 點

共通規則

驗證

所有請求都要在 header 帶上 x-api-key。金鑰由 VoAI 依合約發放, 對應一個帳號的額度與併發上限,請勿放在前端程式碼中

錯誤格式

非 2xx 的回應一律是 JSON,格式固定為 { "msg": "錯誤說明" }。 其中 529 代表併發已達上限,不是伺服器故障,建議用指數退避重試。

採樣率上限依模型而異。 Neo 最高 32000、Sota+ 最高 24000,超過會回傳 400。 未指定時系統會自動選擇該模型的預設值。