Text-to-Speech ภาษาไทย V3 (เสียงน้องไข่ต้ม)
ประกาศเวอร์ชัน Alpha: API นี้อยู่ระหว่างการทดสอบ Alpha บริการอาจมีการใช้งานไม่ต่อเนื่อง โปรดใช้ TTS V2 (เสถียร) สำหรับการใช้งานจริง
ยินดีต้อนรับสู่ API Text-to-Speech ภาษาไทย V3 ที่มาพร้อมกับ เสียงน้องไข่ต้ม (Kaitom Voice) โฉมใหม่เวอร์ชัน 3 เวอร์ชันยุคถัดไปนี้มอบความเป็นธรรมชาติของเสียงพูดที่ได้รับการปรับปรุงอย่างมาก ด้วยการปรับข้อความขั้นสูง, รองรับการโคลนเสียง, และการจัดการภาษาไทย-อังกฤษโดยอัตโนมัติ
มีอะไรใหม่ใน V3
- การปรับข้อความอัจฉริยะ (Smart Text Normalization) - จัดการตัวเลข, วันที่, สกุลเงิน, และอักขระพิเศษโดยอัตโนมัติ
- การตรวจจับภาษาอัตโนมัติ (Automatic Language Detection) - ไม่ต้องระบุโหมดภาษา V3 จัดการภาษาไทย-อังกฤษที่ผสมกันโดยอัตโนมัติ
- ขีดจำกัดอักขระที่ขยายขึ้น - รองรับข้อความสูงสุด 10,000 ตัวอักษรต่อคำขอ
- API JSON ที่ง่ายขึ้น - ส่วนข้อมูลคำขอ JSON ที่สะอาดแทนข้อมูลแบบฟอร์ม
- เสียงคุณภาพสูง - เอาต์พุต WAV 24 kHz สำหรับแอปพลิเคชันระดับมืออาชีพ
ทดลองเดโม — เสียงเริ่มต้น (น้องไข่ต้ม)
ทดลองใช้ AI Demo
เข้าสู่ระบบหรือสร้างบัญชีฟรีเพื่อใช้งาน AI Demo และสำรวจ API ที่ทรงพลังของเรา
รับ 50 เครดิตฟรี (IC) เมื่อสมัครสมาชิก!
โปรโมชันหมดเขต 31 ธันวาคม 2568
V3 automatically handles Thai-English mixed text. No language mode selection needed.
Natural range: 0.8 – 1.2. Default 1.0.
ทดลองเดโม — ก ารโคลนเสียง (ภาษาไทย)
ALPHAอัปโหลดคลิปเสียงภาษาไทยที่ชัดเจนความยาว 8–12 วินาทีพร้อมข้อความที่ตรงกัน และโมเดลจะพูดข้อความภาษาไทยของคุณด้วยเสียงนั้น การโคลนเสียงรองรับ ภาษาไทยเท่านั้น ในขณะนี้
ทดลองใช้ AI Demo
เข้าสู่ระบบหรือสร้างบัญชีฟรีเพื่อใช้งาน AI Demo และสำรวจ API ที่ทรงพลังของเรา
📋 How to use this demo
- Step 1: Record yourself (max 10 seconds) speaking any short Thai sentence — OR upload an existing Thai audio clip.
- Step 2: Type the exact Thai words you spoke into the "Reference Transcript" box. (Word-for-word — not a description.)
- Step 3: Type the new Thai text you want the cloned voice to say.
- Step 4: Click Generate Cloned Voice.
💡 Speak a natural Thai sentence such as: "สวัสดีครับ ผมชื่อไข่ต้ม วันนี้อากาศดีมาก". Recording will stop automatically at 10 seconds.
⚠️ This must match your recording word-for-word. Do not write a description like "เสียงผู้ชายพูดทักทาย" — write the actual sentence you spoke. The clone quality depends on this matching the audio exactly.
Natural range: 0.8 – 1.2. Default 1.0.
เริ่มต้นใช้งาน
-
ข้อกำหนดเบื้องต้น
- คีย์ API จาก iApp Technology
- ข้อความอินพุตเป็นภาษาไทยและ/หรือภาษาอังกฤษ
- ความยาวข้อความสูงสุด: 10,000 ตัวอักษร
- รูปแบบเอาต์พุตที่รองรับ: WAV (24 kHz)
-
เริ่มต้นอย่างรวดเร็ว
- ประมวลผลรวดเร็วพร้อมผลลัพธ์คุณภาพสูง
- การสร้างเสียงพูดที่เป็นธรรมชาติที่ได้รับการปรับปรุง
- รองรับข้อความผสมภาษาไทย-อังกฤษโดยอัตโนมัติ
- ไม่จำเป็นต้องเลือกโหมดภาษา
-
คุณสมบัติหลัก
- เอ็นจิ้นสังเคราะห์เสียงรุ่นถัดไป
- การปรับข้อความอัจฉริยะ (ตัวเลข, วันที่, สกุลเงิน)
- การจัดการภาษาไทย-อังกฤษอัตโนมัติ
- รองรับอิโมจิและอักขระพิเศษ
- ขีดจำกัด 10,000 ตัวอักษรที่ขยายขึ้น
-
ความปลอดภัยและการปฏิบัติตามข้อกำหนด
- เป็นไปตาม GDPR และ PDPA
- ไม่มีการเก็บข้อมูลหลังการประมวลผล
โปรดไปที่หน้า การจัดการคีย์ API เพื่อดูคีย์ API ที่มีอยู่ของคุณหรือขอใหม่
- V2: กำลังมองหา API แบบ POST พร้อมการเลือกโหมดภาษาอยู่ใช่ไหม? ดู Text-to-Speech V2
- V1: กำลังมองหา API แบบ GET แบบเดิมพร้อมเสียง Kaitom V1 หรือ Cee อยู่ใช่ไหม? ดู Text-to-Speech V1
Endpoint API
| Endpoint | Method | Content-Type | คำอธิบาย | ราคา |
|---|---|---|---|---|
/v3/store/audio/tts | POST | application/json | เสียงเริ่มต้น (น้องไข่ต้ม) — ข้อความผสมไทย/อังกฤษ | 1 IC ต่อ 400 ตัวอักษร |
/v3/store/audio/tts/clone | POST | multipart/form-data | การโคลนเสียง — สังเคราะห์ข้อความภาษาไทยด้วยเสียงที่กำหนด เอง | 1 IC ต่อ 400 ตัวอักษร |
/v3/store/audio/tts/detect | POST | multipart/form-data | การตรวจจับลายน้ำ AI — ตรวจสอบว่าคลิปเสียงถูกสร้างโดย AI จาก V3 หรือไม่ | ฟรี |
ตัวอย่างรวดเร็ว
เสียงเริ่มต้น — ตัวอย่างคำขอ
curl -X POST 'https://api.iapp.co.th/v3/store/audio/tts' \
--header 'apikey: YOUR_API_KEY' \
--header 'Content-Type: application/json' \
--data '{"text": "สวัสดีครับ น้องไข่ต้ม เวอร์ชั่น 3", "speed": 1.0}' \
--output 'output.pcm'
การโคลนเสียง — ตัวอย่างคำขอ
curl -X POST 'https://api.iapp.co.th/v3/store/audio/tts/clone' \
--header 'apikey: YOUR_API_KEY' \
--form 'text=สวัสดีครับ วันนี้ทดสอบการโคลนเสียง' \
--form 'speed=1.0' \
--form 'ref_text=ฮัลโหล สวัสดีครับ ผมชื่อไข่ต้ม' \
--form 'ref_audio=@reference.wav' \
--output 'output.pcm'
การตรวจจับลายน้ำ AI — ตัวอย่างคำขอ
curl -X POST 'https://api.iapp.co.th/v3/store/audio/tts/detect' \
--header 'apikey: YOUR_API_KEY' \
--form 'audio=@suspect.wav'
ส่งคืน JSON:
{ "is_ai_generated": true, "confidence": 1.0 }
ตัวอย่างการตอบกลับ
เนื้อหาการตอบกลับเป็น PCM แบบลงนาม 16 บิต Little-endian ดิบ, โมโน, 24 kHz ที่สตรีมเป็น application/octet-stream หากต้องการเล่นหรือบันทึกเป็น .wav ให้ใส่ส่วนหัว WAV:
ffmpeg -f s16le -ar 24000 -ac 1 -i output.pcm output.wav
เอกสารอ้างอิง API
1. Endpoint เสียงเริ่มต้น (น้องไข่ต้ม)
- Endpoint:
POSThttps://api.iapp.co.th/v3/store/audio/tts - Content-Type:
application/json - Headers:
apikey: คีย์ API ของคุณ (จำเป็น)
เนื้อหาคำขอ
| ฟิลด์ | ประเภท | จำเ ป็น | ค่าเริ่มต้น | หมายเหตุ |
|---|---|---|---|---|
text | string | ใช่ | — | สูงสุดประมาณ 1,000 ตัวอักษรไทยต่อการเรียก ข้อความที่ยาวกว่าจะถูกแบ่งส่วนอัตโนมัติฝั่งเซิร์ฟเวอร์ |
speed | float | ไม่ | 1.0 | ช่วงปกติ 0.8–1.2 ค่าต่ำ = ช้าลง |
{
"text": "สวัสดีครับ ยินดีต้อนรับสู่ iApp",
"speed": 1.0
}
2. Endpoint การโคลนเสียง (ภาษาไทยเท่านั้น)
- Endpoint:
POSThttps://api.iapp.co.th/v3/store/audio/tts/clone - Content-Type:
multipart/form-data - Headers:
apikey: คีย์ API ของคุณ (จำเป็น)
ฟิลด์ฟอร์ม
| ฟิลด์ | ประเภท | จำเป็น | ค่าเริ่มต้น | หมายเหตุ |
|---|---|---|---|---|
text | string | ใช่ | — | ข้อความภาษาไทยที่จะสังเคราะห์ |
speed | float | ไม่ | 1.0 | อัตราความเร็วของเสียง |
ref_text | string | ใช่ | — | การถอดเสียงภาษาไทยที่ตรงตามตัว ของ ref_audio (ไม่ใช่คำอธิบาย) |
ref_audio | file | ใช่ | — | WAV หรือ MP3, 8–12 วินาที ของเสียงภาษาไทยที่ชัดเจน |
ข้อจำกัด:
- คลิปอ้างอิงต้อง ≤ 15 วินาที คลิปที่ยาวกว่าจะถูกตัดออกโดยไม่มีการแจ้ง; หาก
ref_textอธิบายส่วนที่ถูกตัด ผลลัพธ์จะเร็วขึ้นและผิดเพี้ยน ref_textต้องตรงกับสิ่งที่พูดในref_audioอย่างถูกต้อง คำต่อคำ- คำขอโคลนเสียงจะถูกประมวลผลตามลำดับต่อเซิร์ฟเวอร์ คาดว่าจะมีความล่าช้าเนื่องจากการรอคิวภายใต้ภาระงานพร้อมกัน
- การโคลนเสียงรองรับ ภาษาไทยเท่านั้น ในขณะนี้
การตอบกลับ (Endpoint TTS + Clone)
- Content-Type:
application/octet-stream - Body: PCM แบบลงนาม 16 บิต Little-endian ดิบ, โมโน, 24 kHz — สตรีมเป็นไบต์ที่เข้ามา
- คำนวณระยะเวลา:
duration_seconds = byte_length / 48000 - หากต้องการบันทึกเป็นไฟล์ที่เล่นได้ ให้ใส่ส่วนหัว WAV (ดู ตัวอย่างเบราว์เซอร์ ด้านล่าง) หรือใช้
ffmpeg -f s16le -ar 24000 -ac 1 -i out.pcm out.wav
3. Endpoint ตรวจจับลายน้ำ AI
ตรวจสอบว่าคลิปเสียงที่กำหนดถูกสร้างโดย Thai TTS V3 หรือไม่ เอาต์พุตทุกอย่างจาก endpoint เสียงเริ่มต้นและโคลนเสียงจะฝังลายน้ำ AudioSeal ที่ไม่สามารถได้ยินได้; endpoint นี้จะอ่านกลับ
- Endpoint:
POSThttps://api.iapp.co.th/v3/store/audio/tts/detect - Content-Type:
multipart/form-data - Headers:
apikey: คีย์ API ของคุณ (จำเป็น)