ข้ามไปยังเนื้อหาหลัก

บริการ

Continue Pretraining

เพิ่มความรู้เฉพาะด้านของคุณเข้าไปในโมเดลพื้นฐาน ก่อนนำไป Finetune

ปรึกษาเราดู OpenThai 2.0 Legal

OpenThai 2.0 Legal เรียนรู้กฎหมายไทยด้วยวิธีนี้ จากแบบฝึกตัวบท 360,985 ชุด ราว 800 ล้าน Token

งานที่เราทำให้​

  • ความรู้ฝังในโมเดลโมเดลเรียนรู้ศัพท์ แนวคิด และสำนวนในสายงานของคุณจากข้อความดิบ
  • ภาษาไทยและภาษาอื่นเสริมโมเดลให้เก่งภาษาไทย หรือภาษาใดก็ได้ที่มีข้อความมากพอ
  • ขยาย Vocabularyถ้าจำเป็น เพิ่มศัพท์เฉพาะทางเข้า Tokenizer ให้ใช้ Token น้อยลง
  • ฐานสำหรับ Finetuningจุดเริ่มต้นที่ดีกว่าสำหรับการ Finetune บนงานของคุณ

ขั้นตอนการทำงาน​

  1. รวบรวม Corpus รวบรวมเอกสาร คู่มือ และบทความของคุณ แล้วตัดข้อมูลซ้ำและคัดกรองคุณภาพ
  2. Pretrain ฝึกโมเดลบน Corpus ของคุณแบบ Next-token prediction
  3. ตรวจสอบ ทดสอบความรู้เฉพาะด้าน และยืนยันว่าความสามารถทั่วไปของโมเดลยังอยู่ครบ

สิ่งที่คุณได้รับ​

  • โมเดลพื้นฐานที่ปรับเข้ากับสายงานของคุณแล้ว พร้อมนำไป Finetune
  • ผลทดสอบความรู้เฉพาะด้านและความสามารถทั่วไป

เริ่มต้น​

บอกเราว่าคุณทำงานด้านไหน และมีข้อความอยู่มากแค่ไหน แล้วเราจะตอบกลับพร้อมขอบเขตงานและใบเสนอราคา อีเมล sale@iapp.co.th หรือโทร 02-124-4041