开放权重
ChindaLLM 4B
小到可以跑在你自己笔记本上的泰语模型。
- 参数量40亿
- 许可Apache 2.0
- 基准平均分0.569
- 泰语语言准确率98.4%
能做什么
- 先思考再作答面向数学与代码的推理模式,需要更快的直接回答时可以关闭。
- 用泰语作答用泰语提问,就用泰语回答,不会返回英文。
- 在你的机器上运行2.5 GB 的量化版本可在笔记本上运行,建议 8 GB 内存。
- 基于你的文档作答把文档内容一并给它,它就依据该内容作答,数据不出网络。
实测
与同规模中表现最好的泰语替代模型对比。数值越高越好。
| 基准 | Chinda 4B | 替代模型 |
|---|---|---|
| 平均(英语与泰语) | 0.569 | 0.414 |
| OpenThaiEval(泰语) | 0.651 | 0.544 |
| MATH500(泰语) | 0.612 | 0.566 |
| LiveCodeBench(英语) | 0.665 | 0.209 |
| IFEval(泰语) | 0.683 | 0.740 |
在 Hugging Face 模型卡的完整对比中,Chinda 4B 仅在泰语 IFEval(见上表)和泰语语言准确率(0.984 对 0.992)上落后。
运行
- Ollama
- Transformers
ollama run iapp/chinda-qwen3-4b
from transformers import AutoModelForCausalLM, AutoTokenizer
name = "iapp/chinda-qwen3-4b"
tok = AutoTokenizer.from_pretrained(name)
model = AutoModelForCausalLM.from_pretrained(name, torch_dtype="auto", device_map="auto")
messages = [{"role": "user", "content": "สรุปเอกสารนี้ให้หน่อย"}]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True, enable_thinking=True)
out = model.generate(**tok([text], return_tensors="pt").to(model.device), max_new_tokens=2048)
print(tok.decode(out[0], skip_special_tokens=True))
设置 enable_thinking=False 可跳过推理过程直接作答。
分步指南:LM Studio · Open WebUI · Ollama · n8n
限制
- 不适合没有附带上下文的事实性问题。40 亿参数的模型不是百科全书,可能说错事实;把文档给它,它能在文档之上做出不错的推理。
- 推理过程需要时间。普通回答就够用时请关闭。
许可
Apache 2.0:可免费使用、修改与部署,包括商业用途,无需上报使用情况。