Inkling Small — โมเดลเล็กลง 4 เท่า แต่คะแนนเกือบไม่ตก เปิด weights ใต้ Apache 2.0
สารบัญ
สรุปให้ไว
เล็กลงเกือบ 4 เท่า
Inkling Small มีพารามิเตอร์รวม 276B (active 12B) เทียบกับ Inkling ตัวเต็ม 975B (active 41B)
คะแนนแทบไม่หาย
บางการทดสอบ reasoning เอาชนะรุ่นใหญ่ ส่วน coding แทบตามทัน
เปิด weights จริง
ปล่อยใต้ลิขสิทธิ์ Apache 2.0 โหลดไปรันเอง ปรับแต่งเองได้
สร้างใน 2 สัปดาห์
ใช้เทคนิค distillation เอารุ่นใหญ่เป็น "ครู" สอนรุ่นเล็ก
01มันคืออะไร
Inkling Small คือโมเดลจากทีม Thinking Machines ที่นำโดย Mira Murati (อดีตหัวหน้าฝ่ายเทคโนโลยีของ OpenAI) ออกตามหลังโมเดลเรือธง Inkling เพียงประมาณสองสัปดาห์ จุดที่ทำให้คนสนใจไม่ใช่แค่ว่ามันเก่ง แต่คือ "เล็กลงมากแต่ยังเก่งใกล้เคียงของเดิม"
วิธีย่อคือเทคนิคที่เรียกว่า distillation — ให้โมเดลใหญ่ทำหน้าที่เป็นครู แล้วให้โมเดลเล็กเรียนวิธีแก้ปัญหาตามจนซึมซับนิสัยที่ดีไว้ โดยไม่ต้องใช้ "สมอง" ขนาดเท่าเดิม จากนั้นทีมยังฝึกต่อด้วย reinforcement learning บนงาน coding อีกสองสัปดาห์ เหมือนซ้อมแล้วมีคนให้คะแนนทุกครั้งจนคมขึ้นเร็ว
02ตัวเลขที่ทำให้ต้องหยุดดู
บนการทดสอบ Humanity's Last Exam ตัว Inkling Small ทำได้ 31.6% แซงหน้า Inkling ตัวเต็มที่ 29.7% ด้วยซ้ำ ส่วนงานเขียนโค้ดบน SWE-Bench Verified ทะลุระดับ 80% และบนดัชนีรวมภายนอกอย่าง Artificial Analysis Intelligence Index ได้ 40 คะแนน ห่างจากรุ่นใหญ่ที่ได้ 41 เพียงแต้มเดียว พูดง่าย ๆ คือโมเดลขนาดราวหนึ่งในสี่ ไล่ตามตัวเต็มมาแบบหายใจรดต้นคอ
ของที่ติดมาในตัว
- ★
Open weights (Apache 2.0)
ไม่ล็อกหลัง paywall หรือแอป ใครก็โหลดไปรันและต่อยอดได้ ภายในวันเดียวมีทั้ง vLLM และ SGLang รองรับ และชุมชนทำเวอร์ชันบีบอัด (GGUF) ให้เครื่องทั่วไปรันไหว
- ★
Multimodal ในสมองเดียว
อ่านและให้เหตุผลจากข้อความ ภาพ และเสียงในโมเดลเดียว ซูมเข้าไปดูรายละเอียดในรูปหรือครอปกราฟมาพิจารณาระหว่างคิดได้
- ★
Context window 1 ล้าน token
ป้อนเอกสารกองใหญ่หรือประวัติแชตยาว ๆ เข้าไปทีเดียว แล้วยังหาจุดที่ต้องการเจอ
- ★
จุดอ่อนที่ทีมบอกตรง ๆ
Inkling ตัวใหญ่ยังชนะเรื่องความรู้ทั่วไปและความแม่นของข้อเท็จจริง ถ้าต้องการจำข้อมูลเป๊ะ ๆ รุ่นใหญ่ยังได้เปรียบ
03เกี่ยวอะไรกับเรา
สำหรับคนทำงานสายเทคนิค นี่คือโมเดล reasoning และ coding ระดับใกล้เรือธงที่เอามารันเองได้ฟรีในเครื่องหรือบนเซิร์ฟเวอร์ของตัวเอง เหมาะกับงานที่ไม่อยากส่งข้อมูลออกไปข้างนอก ฟันธง: **ควรลอง** ถ้าโจทย์คือ reasoning หรือเขียนโค้ด แต่ถ้าต้องการความแม่นเรื่องข้อเท็จจริงล้วน ๆ ให้เลือกรุ่นใหญ่หรือโมเดลปิดที่ถนัดด้านนั้นแทน
ที่น่าจับตายิ่งกว่าตัวโมเดลคือ "สูตร" — ปล่อยรุ่นยักษ์ก่อนเพื่อตั้งเพดาน แล้วรีบย่อเป็นรุ่นเล็กโดยใช้รุ่นยักษ์เป็นครู ทำได้ในสองสัปดาห์เพราะรู้ทางแล้ว ถ้าค่ายอื่นทำตาม ช่องว่างระหว่าง "AI ที่เก่งที่สุด" กับ "AI ที่เรารันเองได้" ก็จะแคบลงเรื่อย ๆ ใครหยิบของใหม่มาลองในสัปดาห์ที่มันออก ย่อมได้เปรียบคนที่รอไปอีกหลายเดือน
04จุดที่ต้องระวัง
การรัน weights เองต้องมีเครื่องและความรู้ระดับหนึ่ง ถ้าไม่ถนัดฝั่งโครงสร้าง แนะนำให้เข้าผ่านบริการอย่าง Tinker Playground หรือเครื่องมือที่สร้างครอบไว้ก่อน แล้วค่อยขยับไป self-host เมื่อพร้อม และอย่าลืมว่าเบนช์มาร์กเป็นภาพรวม งานจริงของเราควรทดสอบกับชุดงานของตัวเองก่อนเอาไปใช้ผลิตจริงเสมอ