โอเพนเวท
OpenThai-SystemOne
โมเดลเปิดที่ไม่เขียน แต่ตัดสินใจ ให้ความน่าจะเป็นของทุกตัวเลือกในการคำนวณรอบเดียว
- พารามิเตอร์800ล้าน
- สัญญาอน ุญาตApache 2.0
- System One benchmark74.3macro
- Output tokens0
ดาวน์โหลดโมเดลเรียกใช้ API ที่โฮสต์ให้
เปิดน้ำหนักโมเดลเมื่อ 20 กันยายน 2569 และเป็นเวอร์ชัน 0.3 ตั้งแต่ 22 กันยายน 2569 ส่วน API ที่โฮสต์ให้ใช้ฟรีในช่วงพรีวิว 100 คำขอต่อนาทีและ 1,000 การตัดสินใจต่อวันต่อ key
ทำอะไรได้บ้าง
- ตอบคำถามเชิงโครงสร้างเลือกหนึ่งตัวเลือกจากตัวเลือกที่ตั้งชื่อไว้สูงสุด 255 ตัว ให้ระ ดับบนสเกล 2 ถึง 10 ระดับ หรือตอบใช่หรือไม่ ส่งหลายคำถามได้ในคำขอเดียว
- บอกความมั่นใจของตัวเองทุกคำตอบมีความน่าจะเป็นที่ปรับเทียบแล้ว ค่าความคลาดเคลื่อนการปรับเทียบ 0.043 ในงานเจตนาภาษาไทย 60 หมวด และ 0.004 ในงานหัวข้อข่าวภาษาไทย คำตอบที่ไม่แน่ใจจึงส่งต่อให้คนตรวจได้
- ตัดสินใจในระดับมิลลิวินาที40 ถึง 70 มิลลิวินาทีสำหรับ 3 คำถามบน H100 หนึ่งใบ และ 154 มิลลิวินาทีบน MacBook M3 Max โดยไม่ต้องสร้าง output tokens
- อ่านภาษาไทยและอังกฤษความแม่นยำ 90.0% ในงานเจตนาภาษาไทย 60 หมวด และ 98.1% ในงานหัวข้อข่าวภาษาไทย ทั้งสองชุดไม่เคยใช้เทรน
ทดลองใช้
ผลการทดสอบ
วัดแบบ zero-shot บน public benchmark 13 ชุดของ Bespoke Labs สำหรับโมเดล System One ใช้ชุดข้อมูล การแบ่ง คำสั่ง และตัวสุ่มเดียวกัน ตัวเลขของอีกสองโมเดลเป็นตัวเลขที่เผยแพร่เมื่อ 18 กันยายน 2569 ส่วนเวอร์ชัน 0.3 วัดด้วยสคริปต์ประเมินผลที่เปิดเผยพร้อมโมเดล ชุดทดสอบภาษาไทยไม่เคยใช้เทรน ผลแยกรายชุดและตารางการปรับเทียบอยู่ใน model card
- System One benchmark
- ชุดทดสอบภาษาไทย
| โมเดล | ค่าเฉลี่ย macro 13 ชุด |
|---|---|
| OpenThai-SystemOne 0.8B | 74.3 |
| Bespoke-Nimble-9B | 74.8 |
| Jev 1.13.0 | 76.0 |
นำโมเดล 9B ใน 8 จาก 13 ชุด และตามหลังใน PubMedQA, VitaminC และงานให้คะแนนบทสรุปสองงาน
| ชุดข้อมูล | ประเภท | ความแม่นยำ | ค่าความคลาดเคลื่อนการปรับเทียบ |
|---|---|---|---|
| เจตนา MASSIVE-th (60 หมวด) | choice | 90.0 | 0.043 |
| หัวข้อข่าว Prachathai67k | choice | 98.1 | 0.004 |
| XNLI-th | choice | 77.1 | 0.045 |
| หัวข้อ SIB-200 ภาษาไทย (7 หมวด) | choice | 77.9 | 0.084 |
| ดาวรีวิว Wongnai (1 ถึง 5) | score | 63.5 | 0.039 |
| ความรู้สึก Wisesight (4 หมวด) | choice | 51.6 | 0.353 |
วิธีรัน
- API ที่โฮสต์ให้
- curl
- เซิร์ฟเวอร์ของคุณเอง
เรียกใช้ด้วย iApp API key: สมัครสมาชิก แล้วเลือก API Keys และ Create New API Key ใช้ฟรีในช่วงพรีวิว 100 คำขอต่อนาทีและ 1,000 การตัดสินใจต่อวันต่อ key จะประกาศราคาต่อการตัดสินใจภายหลัง เอกสารฉบับเต็ม: OpenThai-SystemOne API
import requests
r = requests.post(
"https://api.iapp.co.th/v3/store/openthai/systemone",
headers={"apikey": "YOUR_IAPP_API_KEY"},
json={
"state": {"ticket": "โดนหักเงินซ้ำสองครั้งเมื่อวานนี้ ขอเงินคืนด่วนนะครับ"},
"questions": {
"department": {"type": "choice", "instructions": "ทีมใดควรรับผิดชอบ",
"criteria": {"billing": "การเงิน/คืนเงิน", "technical": "ระบบใช้งานไม่ได้",
"sales": "สอบถามสินค้าและราคา"}},
"refund": {"type": "noul", "instructions": "ลูกค้าขอเงินคืนอย่างชัดเจนหรือไม่"},
},
},
)
answers = r.json()["answers"]
print(answers["department"]["choice"], answers["department"]["confidence"], answers["refund"]["noul"])
curl -s https://api.iapp.co.th/v3/store/openthai/systemone \
-H "Content-Type: application/json" -H "apikey: YOUR_IAPP_API_KEY" \
-d '{"state": "แอปโอนเงินใช้ไม่ได้ตั้งแต่เมื่อคืน", "questions": {"urgent": {"type": "noul", "instructions": "เรื่องนี้เร่งด่วนหรือไม่"}}}'
น้ำหนักโมเดลแบบเปิดให้บริการ API เดียวกันบนเครื่องของคุณ ที่ POST http://localhost:8000/v1/systemone ด้วย body เดียวกัน
pip install "git+https://github.com/iapp-technology/openthai-systemone"
OPENTHAI_SYSTEMONE_MODEL=iapp/OpenThai-SystemOne uvicorn openthai_systemone.server:app --port 8000
การอ่านคำตอบ
| ฟิลด์ | ความหมาย |
|---|---|
choice | ตัวเลือกที่มีความน่าจะเป็นสูงสุด probabilities รวมกันได้ 1 ในตัวเลือกที่คุณให้ |
score | ระดับถ่วงน้ำหนักด้วยความน่าจะเป็น เป็นทศนิยมได้ |
noul | ความน่าจะเป็นที่คำตอบคือใช่ |
confidence | 1 ลบด้วยเอนโทรปีที่ทำให้เป็นมาตรฐาน ค่าต่ำควรส่งต่อให้โมเดลที่ใหญ่กว่าหรือให้คนตรวจ |
ข้อจำกัด
- เวอร์ชัน 0.3 โมเดลขนาด 0.8B รับข้อความอย่างเดียว และไม่ใช่โมเดลคิดวิเคราะห์
- ตอบได้เฉพาะตัวเลือกที่คุณให้ แต่ยังเลือกผิดได้ คำตอบที่ความมั่นใจต่ำควรส่งต่อ
- ทำได้อ่อนที่สุดในงานให้คะแนน 5 ระดับสองงาน (ความเกี่ยวข้องของบทสรุป 21.7, ความช่วยเหลือ 41.6) PubMedQA (64.0) ความรู้สึกในโซเชียลมีเดียไทย (Wisesight 51.6) และเจตนาภาษาอังกฤษ 77 หมวด (banking77 45.4) การตัดสินความสุภาพของภาษาไทยทางการเป็นช่องว่างที่ทราบแล้ว และตั้งเป้าแก้ในเวอร์ชัน 0.4
- ตัวเลือกไม่เกิน 255 ตัวต่อคำถาม choice ระดับ 2 ถึง 10 ระดับต่อคำถาม score และไม่เกิน 64K tokens ต่อคำขอ
หลักการทำงานและประวัติเวอร์ชันอยู่ในบทความเปิดตัว และเดโมการเล่นเกมแบบเรียลไทม์อยู่บน GitHub