Thinking Machines เปิด Inkling — โมเดลโอเพนเวท 975B ฟัง "เสียงดิบ" ได้ตรง ๆ เกิดมาเพื่อให้ fine-tune
สารบัญ
สรุปให้ไว
แล็บ Mira Murati ส่งโมเดลแรก
Thinking Machines เปิด Inkling โมเดลโอเพนเวท 975B พารามิเตอร์ ใบอนุญาต Apache 2.0 โหลดได้บน Hugging Face
มัลติโมดัลจริง
รับ text ภาพ และ "เสียงดิบ" เข้าโมเดลตรง ๆ ไม่ต้องถอดเป็นข้อความก่อน จึงเสียข้อมูลระหว่างทางน้อยลง
เกิดมาเพื่อ fine-tune
จุดเด่นไม่ใช่เอามารันเปล่า ๆ แต่คือฐานให้ปรับจูนงานเฉพาะทางผ่านแพลตฟอร์ม Tinker
สไลเดอร์คิดหนักคิดเบา
ตั้งค่าความพยายามในการคิดได้เป็นตัวเลข 0 ถึง 1 ละเอียดกว่าปุ่ม low/medium/high
01Inkling คืออะไร
Inkling คือโมเดลตัวแรกจาก Thinking Machines แล็บที่ก่อตั้งโดย Mira Murati อดีต CTO ของ OpenAI เป็นโมเดลโอเพนเวทขนาด 975 พันล้านพารามิเตอร์ ปล่อยภายใต้ใบอนุญาต Apache 2.0 และวาง weights ไว้บน Hugging Face ให้ใครก็โหลดไปใช้ได้
ทางแล็บพูดตรง ๆ ตั้งแต่แรกว่าโมเดลนี้ไม่ได้ตั้งใจไปสู้กับโมเดล generalist ตัวท็อปในตลาด แต่ออกแบบมาเป็น "ฐานที่ดี" สำหรับเอาไป fine-tune ให้เก่งงานแคบ ๆ ที่เจาะจง ถ้าใครต้องการโมเดลที่เทรนมาเพื่อ task เฉพาะทางของตัวเอง นี่คือกลุ่มเป้าหมายที่ตรงที่สุด
02จุดที่ต่างจากคนอื่น คือวิธีกินภาพและเสียง
ปกติเวลาโมเดลจะรับเสียง มักมีโมเดลถอดเสียงแยกอยู่ข้างหน้า คอยแปลงเสียงเป็นข้อความก่อนแล้วค่อยส่งข้อความต่อให้โมเดลภาษา ภาพก็ทำนองเดียวกัน คือมี vision encoder อธิบายภาพเป็นคำก่อน วิธีนี้ทำให้ข้อมูลบางส่วนหล่นหายระหว่างแปลง
Inkling ไม่ทำแบบนั้น เสียงถูกส่งเข้าไปตรง ๆ ในรูป spectrogram คือย่านความถี่ดิบ ๆ ของเสียงที่หั่นเป็นช่อง ส่วนภาพก็เข้าไปเป็นแพตช์ขนาด 40x40 พิกเซล ทั้งหมดถูกโยนเข้าไปอยู่ในพื้นที่เดียวกับ text token แล้วให้โมเดลมองพร้อมกัน ผลคือทางทฤษฎีข้อมูลถูกบีบอัดหายน้อยลง โดยเฉพาะงานที่ต้องเข้าใจ "วิธีที่พูด" ไม่ใช่แค่ "พูดว่าอะไร"
สเปกและตัวเลขที่ควรรู้
- ★
สถาปัตยกรรม MoE
975B พารามิเตอร์รวม แต่ละ token เรียกผู้เชี่ยวชาญ 6 ตัว เหลือทำงานจริงราว 41B พารามิเตอร์
- ★
รับเสียงดิบตัวเดียวบน Tinker
ในบรรดาโมเดลบนแพลตฟอร์ม Tinker Inkling เป็นตัวเดียวที่รับ raw audio ได้
- ★
Instruction following ดี
เอาชนะ GLM-130B ที่ 79.8 ต่อ 73.3
- ★
สาย agent ยังเป็นรอง
บน terminal bench แพ้ที่ 63.8 ต่อ 82.7 เก่งทำตามคำสั่ง แต่ยังอ่อนเรื่องคิดเองทำเอง
- ★
fine-tune แบบ LoRA
ปรับจูนด้วย low-rank adaptation ที่แช่ weights เดิมไว้ ประหยัดต้นทุนกว่าเทรนใหม่ทั้งตัว
03เกี่ยวอะไรกับเรา
ฟันธง: สำหรับคนทั่วไปที่อยากได้โมเดลมารันแล้วเก่งเลย Inkling ไม่ใช่คำตอบ และแล็บก็บอกเองชัด ๆ แบบนั้น แต่ถ้างานของเราคือ task แคบ ๆ ปริมาณเยอะ มีข้อมูล label จริง และมีวิธีให้คะแนนผลลัพธ์ได้ การ fine-tune โมเดลโอเพนเล็ก ๆ คือหนึ่งในของที่คุ้มและถูกมองข้ามที่สุดตอนนี้ ยิ่งงานไหนมีเสียงเข้ามาเกี่ยว เช่น แยกสไตล์การพูด หรือถอดศัพท์เฉพาะทางอย่างชื่อยา Inkling มีจุดแข็งที่หาจากตัวอื่นบนแพลตฟอร์มเดียวกันไม่ได้
จุดที่ต้องระวัง: fine-tune สอนโมเดล "วิธีตอบ" ไม่ได้สอน "สิ่งที่ควรรู้" ถ้าอยากให้มันรู้ข้อมูลใหม่ การทำ retrieval มักได้ผลดีกว่าและมีงานวิจัยรองรับ อีกทั้งการ fine-tune อาจทำให้การให้เหตุผลของโมเดลแย่ลงในบางเคส สรุปคือเลือกใช้ให้ตรงงาน อย่าใช้ fine-tune เป็นค้อนที่ตีทุกตะปู
โปรเจกต์ open-source
อยากลองเองไหม? โปรเจกต์นี้เป็น open-source โหลด repo ทางการมาลองได้เลย
ดูบน Hugging Face → →