OpenThai-SystemOne
可在笔记本上运行的开源泰语与英语 System One 模型。它不写作,它做决策。
iapp/OpenThai-SystemOne · 0.8B 参数 · Apache 2.0
给它一个 state(任意文本或 JSON:客服工单、评论、文档、界面无障碍树)和一个或多个结构化 问题。它在一次前向计算中返回每个问题每个选项的校准概率,输出 token 为零。三种问题类型:choice(最多 255 个命名选项)、score(2 到 10 个有序等级)和 noul(是或否)。
由 iApp Technology 与 OpenThaiGPT 社区共同构建。基础模型:Qwen3.5-0.8B 的文本塔(Apache 2.0),在约 50 亿泰语 token 上继续预训练。训练数据、脚本和配置随权重一同发布。
什么是 System One 模型
语言模型通过逐 token 生成文本来回答,可以说任何内容,包括你从未提供的选项。System One 模型直接回答结构化问题:语言模型头被替换为 256 路决策头,每个答案位置投影到你给出的选项上,softmax 给出分布。它不会输出无效选项。但它仍可能出错,因此每个答案都带有可用于分流的 confidence。
该类别由 TypeSafe AI 于 2026 年 9 月 15 日以 Jev 开创。OpenThai-SystemOne 是五天后发布的面向泰语和英语的开源重新实现,架构、方案和数据全部开放。HTTP 接口与 POST /v1/systemone 一致,为该 API 编写的 SDK 代码无需修改即可指向本模型。
一次请求,三个决策
一条泰语客服工单,三个问题,一次调用。已发布检查点的实测输出:
| 问题 | 类型 | 答案 | 置信度 |
|---|---|---|---|
| 哪个团队应处理? | choice(billing、technical、sales) | billing,96.3% | 0.83 |
| 客户有多沮丧? | score(冷静、不满但礼貌、非常生气) | 1.95 / 2 | 0.82 |
| 是否明确要求退款? | noul | P(是) = 0.946 |
166 个输入 token,0 个输出 token,经网关往返 0.23 秒。完整请求与响应见 API 页面。
应用场景
- 将客服工单分流到正确的团队,同时评估紧急程度。
- 审核评论:毒性为是/否,情感为选项。
- 判断 LLM 的答案是否基于检索到的段落。
- 从无障碍树中选择智能体下一步应操作的界面元素及操作方 式。
- 用一个问题对文档和字段进行最多 255 类的分类。
- 按有序量表为评论打分,得到小数平均值而不只是标签。
每一项都是服务器 GPU 上几十毫秒内的一次请求。泰国企业每天要做数百万次这样的决策,无法为每一次都调用完整的 LLM。
性能
| 设置 | 实测 |
|---|---|
| 服务器 GPU(H100),batch 1,3 个问题 | 40 至 70 毫秒 |
| 笔记本 GPU(MacBook M3 Max,MPS) | 154 毫秒 |
| 网关往返,上述工单示例 | 0.23 秒 |
| 输出 token | 0 |
基准测试
在 Bespoke Labs 公开的 13 子集 System One 基准上 macro 平均 61.9,对比 Bespoke-Nimble-9B 74.8、Jev 1.13.0 76.0、原始 Qwen3.5-0.8B 基座 45.4。 与 Bespoke 公布的基准使用相同的子集、划分、指令和采样器;其数字为 2026 年 9 月 18 日公布,我们的数字来自发布的评测脚本。加粗表示 0.8B 模型领先 9B 模型。
| 子集 | 类型 | n | OpenThai-SystemOne 0.8B | Nimble-9B | Jev 1.13.0 |
|---|---|---|---|---|---|
| aegis2 | noul | 250 | 58.0 | 81.2 | 80.4 |
| boolq | noul | 300 | 63.7 | 86.0 | 89.7 |
| civil_comments | noul | 300 | 78.0 | 70.3 | 81.0 |
| helpsteer2 | score | 250 | 42.8 | 39.0 | 34.1 |
| massive-de-DE | choice | 350 | 64.6 | 83.4 | 86.9 |
| massive-en-US | choice | 350 | 75.7 | 86.9 | 87.4 |
| multinli | choice | 299 | 85.6 | 85.3 | 82.9 |
| paws | noul | 250 | 67.2 | 82.8 | 89.2 |
| pubmedqa | choice | 250 | 53.6 | 75.6 | 77.2 |
| squad2 | noul | 299 | 50.2 | 80.6 | 82.9 |
| summeval-consistency | score | 144 | 84.0 | 75.7 | 81.2 |
| summeval-relevance | score | 240 | 13.8 | 49.2 | 35.0 |
| vitaminc-dev | choice | 599 | 67.1 | 76.6 | 80.1 |
| macro 平均 | 61.9 | 74.8 | 76.0 |
如实解读:在 13 个子集中的 4 个领先 9B(NLI、摘要一致性、有用性评分、毒性),在阅读理解式是/否任务(squad2 接近随机、boolq、pubmedqa)和摘要相关性评分上明显落后,后者的评分头校准较差(ECE 0.79)。
泰语留出测试集,从未用于训练(ECE = 期望校准误差,越低越好):
| 测试集 | 类型 | n | 准确率 | ECE |
|---|---|---|---|---|
| MASSIVE-th 意图(60 类) | choice | 5,007 | 86.4 | 0.048 |
| Prachathai67k 主题 | choice | 3,501 | 97.7 | 0.005 |
| XNLI-th | choice | 2,490 | 76.5 | 0.028 |
| SIB-200 泰语主题(7 类),整个数据集留出 | choice | 204 | 77.5 | 0.074 |
| Wongnai 评论星级(1 至 5) | score | 6,203 | 63.3 | 0.010 |
| xLAM 工具选择(英语) | choice | 884 | 99.4 | 0.007 |
| Wisesight 情感(4 类),整个数据集留出 | choice | 2,671 | 38.7 | 0.341 |
| banking77 意图(77 类,英语),整个数据集留出 | choice | 3,076 | 32.7 | 0.165 |
校准后,置信度在泰语测试集以及 NLI 和主题任务上可靠(ECE 不超过 0.05)。英语校准较弱(公开基准 ECE 中位数 0.15),因为训练混合有意偏重泰语。共享 H100 上单个 255 选项问题的 batch-1 延迟:44 毫秒。完整表格、Brier 分数和校准前后对比见模型卡。
免费托管 API
api.iapp.co.th 上的端点在预览期内使用任意 iApp API key 免费(注册免费),每个 key 每天限 1,000 次决策。按决策计价的价格将于 2026 年 10 月公布。
| 端点 | POST https://api.iapp.co.th/v3/store/openthai/systemone |
| 认证 | apikey 请求头 |
| 请求体 | {"state": ..., "questions": {...}} |
| 文档与体验 | /docs/llm/openthai-systemone |
自行运行
pip install "git+https://github.com/iapp-technology/openthai-systemone"
OPENTHAI_SYSTEMONE_MODEL=iapp/OpenThai-SystemOne uvicorn openthai_systemone.server:app --port 8000
然后用与托管 API 相同的请求体 POST http://localhost:8000/v1/systemone。
架构
Qwen3.5-0.8B 的文本塔(去除视觉编码器),在约 50 亿泰语 token 上继续预训练。248K token 的语言模型头替换为 1024 到 256 的线性槽位头。选项由控制 token 引入;每个答案位置读出为 256 个 logit,超出选项数的槽位被屏蔽,第 255 号槽位为"均不适用"(abstain)。choice 取 argmax,score 为概率加权的等级索引,noul 为 P(是)。训练时打乱选项顺序,因此没有位置偏差。在公开的分类、NLI、问答和智能体数据集以及合成的泰语与英语决策任务上训练,然后进行校准。
限制,事先说明
- 0.1 版。0.8B 模型,不是推理模型。
- 不会输出无效选项,但仍可能选错。将
confidence低的答案交给更大的模型或人 工。 - 仅支持文本。
- 每个
choice最多 255 个选项,每个score2 到 10 个等级,每次请求 64K token。 - v0.1 已知弱项:泰语社交媒体情感(Wisesight 38.7)、细粒度 77 类英语意图(banking77 32.7)、抽取式问答风格的是/否(squad2 接近随机)以及摘要相关性评分。v0.2 增加合成泰语情感数据集和第二轮训练,以第一项为目标。
- "System One" 是类别名称;这不是 TypeSafe AI 的产品。
赞助方
本模型的训练、评测和免费托管 API 均运行在 Siam AI Corporation 慷慨提供的 NVIDIA H100 GPU 上。感谢他们对开源泰语 AI 的支持。
链接
- 权重与模型卡:huggingface.co/iapp/OpenThai-SystemOne
- 代码、训练方案与服务器:github.com/iapp-technology/openthai-systemone
- API 文档与体验:/docs/llm/openthai-systemone
- 系列中的其他模型:OpenThai 2.0、OpenThai 2.0 Legal