OpenThai 2.0 — โมเดลเปิดหนึ่งเดียวที่อ่านเอกสารไทย รู้เรื่องเมืองไทย และทำงานเอเจนต์ได้

วันนี้ เราร่วมกับสมาคมผู้ประกอบการปัญญาประดิษฐ์ประเทศไทย (AIEAT) เปิดตัว OpenThai 2.0 — โมเดล vision-language ภาษาไทยแบบโอเพนซอร์ส ขนาด 27B พารามิเตอร์ สัญญาอนุญาต Apache 2.0 ดาวน์โหลดน้ำหนักโมเดลได้ฟรีบน Hugging Face
เมื่อหนึ่งเดือนก่อนเราเปิดตัว OpenThai 2.0 Legal โมเดลเฉพาะทางที่จำตัวบทกฎหมายไทยได้ขึ้นใจ OpenThai 2.0 คือพี่น้องสายงานทั่วไปของมัน และเป็นการเปิดตัวที่ใหญ่กว่า: โมเดลเดียวที่อ่านเอกสารและลายมือไทยได้ระดับโมเดลเฉพาะทาง ตอบคำถามความรู้ไทยเป็นภาษาไทยธรรมชาติ และเรียกใช้เครื่องมือได้เสถียรพอที่จะรันเป็นเอเจนต์ — โดยยังคงความฉลาดทั่วไปของโมเดลฐานไว้คร บ
หน้าโมเดล: iapp.co.th/th/openmodels/openthai2p0 · น้ำหนักโมเดล: huggingface.co/iapp/openthai2.0-qwen3.8-27b · ทดลองฟรี ไม่ต้องติดตั้ง: chinda3.iapp.co.th
ทำไม "โมเดลเดียว" ถึงสำคัญ
ระบบเอกสารภาษาไทยที่ใช้งานจริงทุกวันนี้ล้วนเป็นไปป์ไลน์: เอนจิน OCR ที่อ่านได้แต่คิดไม่ได้ ส่งต่อให้โมเดลภาษาที่คิดได้แต่อ่านไม่ได้ ทุกจุดส่งต่อสูญเสียเลย์เอาต์ บริบท และความมั่นใจ — และไม่มีฝั่งไหนตรวจสอบอีกฝั่งได้
OpenThai 2.0 คือทั้งสองฝั่งในน้ำหนักชุดเดียว ยื่นหน้าราชก ิจจานุเบกษาให้ มันถอดความได้ ถามคำถามเกี่ยวกับหน้านั้น มันตอบเป็นภาษาไทยเชิงอธิบาย ต่อเครื่องมือให้ มันจัดการงานต่อจนจบ นี่คือโมเดลเปิดภาษาไทยตัวเดียวที่เราวัดพบว่า ทั้งอ่านเอกสารได้ระดับโมเดลเฉพาะทางและตอบคำถามจากเอกสารนั้นได้ในโมเดลเดียวกัน
ตัวเลข
ผลทั้งหมดวัดโดยทีมงานเรา ทุกโมเดลรันบนชุดทดสอบเดียวกันภายใต้เงื่อนไขการให้บริการเหมือนกัน แต่ละโมเดลใช้พรอมต์ที่ผู้พัฒนาแนะนำเอง — ทำซ้ำได้ด้วยเช็กพอยต์สาธารณะ ตารางเต็มและผลรายหมวดอยู่ที่หน้าโมเดลและในรีโพซิทอรีบน Hugging Face
การอ่านภาษาไทย (อัตราความผิดพลาดระดับตัวอักษร — ยิ่งต่ำยิ่งดี):
| งาน | OpenThai 2.0 | โมเดลฐาน Qwen3.8-27B |
|---|---|---|
| ลายมือไทย (n=916) | 0.261 | 0.649 |
| หนังสือและราชกิจจานุเบกษา (n=608) | 0.126 | 0.370 |
| เอกสารราชการ (n=906) | 0.327 | 0.530 |
| เอกสารสิ่งพิมพ์ (n=104) | 0.077 | 0.103 |
ความผิดพลาดลดลง 60% บนลายมือ และ 66% บนหนังสือและราชกิจจานุเบกษา ตัวอย่างจริงจากชุดทดสอบลายมือ: โมเดลฐานอ่านคำว่า "เชียงราย" เป็น "3.1.4 การจ่าย" — ผิดทั้งหมด OpenThai 2.0 อ่านได้ถูกต้องทุกตัวอักษร
ความรู้ไทยและการทำตามคำสั่ง (ยิ่งสูงยิ่งดี):
| งาน | OpenThai 2.0 | ฐาน | Typhoon 2.5 | Pathumma 3.0 |
|---|---|---|---|---|
| OpenThaiEval — ข้อสอบระดับชาติ | 0.842 | 0.820 | 0.742 | 0.660 |
| IFEval-TH — ทำตามคำสั่งภาษาไทย | 0.795 | 0.772 | 0.749 | 0.498 |
| HumanEval — เขียนโค้ด | 0.957 | 0.939 | 0.957 | 0.805 |
การใช้เครื่องมือแบบเอเจนต์ ด้วย harness ทางการของ BFCL (3,841 เคส):
| งาน | OpenThai 2.0 | ฐาน | Typhoon 2.5 |
|---|---|---|---|
| BFCL รวม | 0.820 | 0.811 | 0.792 |
| งานเอเจนต์หลายรอบสนทนา | 0.775 | 0.750 | 0.550 |
ปกติการจูนภาษาไทยต้องแลกด้วยความสามารถด้านอื่น แต่ครั้งนี้ไม่ใช่: โมเดลนำโมเดลฐานทั้งด้านการใช้เครื่องมือและการเขียนโค้ดไปพร้อมกับที่ได้ทักษะภาษาไทยมา โดยยอมเสียเพียง 0.008 บนความรู้รอบตัว (MMLU-Redux 0.916 เทียบกับ 0.924)
เราเผยแพร่ด้านที่แพ้ด้วย: โมเดลถอดความเฉพาะทาง (Typhoon-OCR 1.5) ยังชนะบนบรรทัดสิ่งพิมพ์สะอาดและลายมือแยกส่วน ตัวอักษรในภาพถ่ายยังเป็นด้านที่อ่อนที่สุด และการสกัดตารางแบบมีโครงสร้างเทียบเท่าโมเดลฐาน — การเปรียบเทียบฉบับเต็มพร้อมตัวเลขทุกตัวอยู่ที่หน้าโมเดล