Call Me Thanut
puzzleOpen Source

Thinking Machines เปิด Inkling — โมเดลโอเพนเวท 975B ฟัง "เสียงดิบ" ได้ตรง ๆ เกิดมาเพื่อให้ fine-tune

23 ก.ค. 2026อ่าน 5 นาที
Thinking Machines เปิด Inkling — โมเดลโอเพนเวท 975B ฟัง "เสียงดิบ" ได้ตรง ๆ เกิดมาเพื่อให้ fine-tune
สารบัญ

สรุปให้ไว

แล็บ Mira Murati ส่งโมเดลแรก

Thinking Machines เปิด Inkling โมเดลโอเพนเวท 975B พารามิเตอร์ ใบอนุญาต Apache 2.0 โหลดได้บน Hugging Face

มัลติโมดัลจริง

รับ text ภาพ และ "เสียงดิบ" เข้าโมเดลตรง ๆ ไม่ต้องถอดเป็นข้อความก่อน จึงเสียข้อมูลระหว่างทางน้อยลง

เกิดมาเพื่อ fine-tune

จุดเด่นไม่ใช่เอามารันเปล่า ๆ แต่คือฐานให้ปรับจูนงานเฉพาะทางผ่านแพลตฟอร์ม Tinker

สไลเดอร์คิดหนักคิดเบา

ตั้งค่าความพยายามในการคิดได้เป็นตัวเลข 0 ถึง 1 ละเอียดกว่าปุ่ม low/medium/high

01Inkling คืออะไร

Inkling คือโมเดลตัวแรกจาก Thinking Machines แล็บที่ก่อตั้งโดย Mira Murati อดีต CTO ของ OpenAI เป็นโมเดลโอเพนเวทขนาด 975 พันล้านพารามิเตอร์ ปล่อยภายใต้ใบอนุญาต Apache 2.0 และวาง weights ไว้บน Hugging Face ให้ใครก็โหลดไปใช้ได้

ทางแล็บพูดตรง ๆ ตั้งแต่แรกว่าโมเดลนี้ไม่ได้ตั้งใจไปสู้กับโมเดล generalist ตัวท็อปในตลาด แต่ออกแบบมาเป็น "ฐานที่ดี" สำหรับเอาไป fine-tune ให้เก่งงานแคบ ๆ ที่เจาะจง ถ้าใครต้องการโมเดลที่เทรนมาเพื่อ task เฉพาะทางของตัวเอง นี่คือกลุ่มเป้าหมายที่ตรงที่สุด

02จุดที่ต่างจากคนอื่น คือวิธีกินภาพและเสียง

ปกติเวลาโมเดลจะรับเสียง มักมีโมเดลถอดเสียงแยกอยู่ข้างหน้า คอยแปลงเสียงเป็นข้อความก่อนแล้วค่อยส่งข้อความต่อให้โมเดลภาษา ภาพก็ทำนองเดียวกัน คือมี vision encoder อธิบายภาพเป็นคำก่อน วิธีนี้ทำให้ข้อมูลบางส่วนหล่นหายระหว่างแปลง

Inkling ไม่ทำแบบนั้น เสียงถูกส่งเข้าไปตรง ๆ ในรูป spectrogram คือย่านความถี่ดิบ ๆ ของเสียงที่หั่นเป็นช่อง ส่วนภาพก็เข้าไปเป็นแพตช์ขนาด 40x40 พิกเซล ทั้งหมดถูกโยนเข้าไปอยู่ในพื้นที่เดียวกับ text token แล้วให้โมเดลมองพร้อมกัน ผลคือทางทฤษฎีข้อมูลถูกบีบอัดหายน้อยลง โดยเฉพาะงานที่ต้องเข้าใจ "วิธีที่พูด" ไม่ใช่แค่ "พูดว่าอะไร"

สเปกและตัวเลขที่ควรรู้

  • สถาปัตยกรรม MoE

    975B พารามิเตอร์รวม แต่ละ token เรียกผู้เชี่ยวชาญ 6 ตัว เหลือทำงานจริงราว 41B พารามิเตอร์

  • รับเสียงดิบตัวเดียวบน Tinker

    ในบรรดาโมเดลบนแพลตฟอร์ม Tinker Inkling เป็นตัวเดียวที่รับ raw audio ได้

  • Instruction following ดี

    เอาชนะ GLM-130B ที่ 79.8 ต่อ 73.3

  • สาย agent ยังเป็นรอง

    บน terminal bench แพ้ที่ 63.8 ต่อ 82.7 เก่งทำตามคำสั่ง แต่ยังอ่อนเรื่องคิดเองทำเอง

  • fine-tune แบบ LoRA

    ปรับจูนด้วย low-rank adaptation ที่แช่ weights เดิมไว้ ประหยัดต้นทุนกว่าเทรนใหม่ทั้งตัว

03เกี่ยวอะไรกับเรา

ฟันธง: สำหรับคนทั่วไปที่อยากได้โมเดลมารันแล้วเก่งเลย Inkling ไม่ใช่คำตอบ และแล็บก็บอกเองชัด ๆ แบบนั้น แต่ถ้างานของเราคือ task แคบ ๆ ปริมาณเยอะ มีข้อมูล label จริง และมีวิธีให้คะแนนผลลัพธ์ได้ การ fine-tune โมเดลโอเพนเล็ก ๆ คือหนึ่งในของที่คุ้มและถูกมองข้ามที่สุดตอนนี้ ยิ่งงานไหนมีเสียงเข้ามาเกี่ยว เช่น แยกสไตล์การพูด หรือถอดศัพท์เฉพาะทางอย่างชื่อยา Inkling มีจุดแข็งที่หาจากตัวอื่นบนแพลตฟอร์มเดียวกันไม่ได้

จุดที่ต้องระวัง: fine-tune สอนโมเดล "วิธีตอบ" ไม่ได้สอน "สิ่งที่ควรรู้" ถ้าอยากให้มันรู้ข้อมูลใหม่ การทำ retrieval มักได้ผลดีกว่าและมีงานวิจัยรองรับ อีกทั้งการ fine-tune อาจทำให้การให้เหตุผลของโมเดลแย่ลงในบางเคส สรุปคือเลือกใช้ให้ตรงงาน อย่าใช้ fine-tune เป็นค้อนที่ตีทุกตะปู

โปรเจกต์ open-source

อยากลองเองไหม? โปรเจกต์นี้เป็น open-source โหลด repo ทางการมาลองได้เลย

ดูบน Hugging Face →