Tham Khảo API
Âm Thanh & TTS
Chuyển đổi văn bản thành giọng nói và giọng nói thành văn bản thông qua API hợp nhất tương thích OpenAI. Truy cập các mô hình từ OpenAI, ElevenLabs và các nhà cung cấp âm thanh khác.
Chuyển Văn Bản Thành Giọng Nói (TTS)
http
POST https://api.tokspan.com/v1/audio/speechTham Số
| Tham Số | Kiểu | Bắt Buộc | Mô Tả |
|---|---|---|---|
| model | string | Có | Mô hình TTS: tts-1, tts-1-hd, gpt-4o-mini-tts |
| input | string | Có | Văn bản cần chuyển thành giọng nói (tối đa 4096 ký tự) |
| voice | string | Có | Giọng nói: alloy, echo, fable, onyx, nova, shimmer |
| response_format | string | Không | mp3 (mặc định), opus, aac, flac, wav, pcm |
| speed | number | Không | Tốc độ phát: 0.25 đến 4.0. Mặc định: 1.0 |
Ví Dụ
python
from openai import OpenAI
client = OpenAI(
api_key="sk-your-key",
base_url="https://api.tokspan.com/v1",
)
# Text-to-Speech
response = client.audio.speech.create(
model="tts-1",
voice="alloy",
input="Hello! Welcome to TokSpan.",
)
response.stream_to_file("output.mp3")Chuyển Giọng Nói Thành Văn Bản (STT)
http
POST https://api.tokspan.com/v1/audio/transcriptionsTham Số
| Tham Số | Kiểu | Bắt Buộc | Mô Tả |
|---|---|---|---|
| model | string | Có | Mô hình STT: whisper-1 |
| file | file | Có | Tệp âm thanh (mp3, mp4, mpeg, mpga, m4a, wav, webm) |
| language | string | Không | Mã ngôn ngữ ISO 639-1 để cải thiện độ chính xác |
| response_format | string | Không | json (mặc định), text, srt, vtt, verbose_json |
| temperature | number | Không | Nhiệt độ lấy mẫu (0–1). Mặc định: 0 |
Ví Dụ
python
# Speech-to-Text (Whisper)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
response_format="text",
)
print(transcript)Mô Hình Khả Dụng
Xem trang Mô Hình để biết tất cả nhà cung cấp TTS và STT được hỗ trợ, bao gồm OpenAI TTS, Whisper và ElevenLabs.