Call Me Thanut
puzzleOpen Source

Inkling Small — โมเดลเล็กลง 4 เท่า แต่คะแนนเกือบไม่ตก เปิด weights ใต้ Apache 2.0

3 ส.ค. 2026อ่าน 4 นาที
Inkling Small — โมเดลเล็กลง 4 เท่า แต่คะแนนเกือบไม่ตก เปิด weights ใต้ Apache 2.0
สารบัญ

สรุปให้ไว

เล็กลงเกือบ 4 เท่า

Inkling Small มีพารามิเตอร์รวม 276B (active 12B) เทียบกับ Inkling ตัวเต็ม 975B (active 41B)

คะแนนแทบไม่หาย

บางการทดสอบ reasoning เอาชนะรุ่นใหญ่ ส่วน coding แทบตามทัน

เปิด weights จริง

ปล่อยใต้ลิขสิทธิ์ Apache 2.0 โหลดไปรันเอง ปรับแต่งเองได้

สร้างใน 2 สัปดาห์

ใช้เทคนิค distillation เอารุ่นใหญ่เป็น "ครู" สอนรุ่นเล็ก

01มันคืออะไร

Inkling Small คือโมเดลจากทีม Thinking Machines ที่นำโดย Mira Murati (อดีตหัวหน้าฝ่ายเทคโนโลยีของ OpenAI) ออกตามหลังโมเดลเรือธง Inkling เพียงประมาณสองสัปดาห์ จุดที่ทำให้คนสนใจไม่ใช่แค่ว่ามันเก่ง แต่คือ "เล็กลงมากแต่ยังเก่งใกล้เคียงของเดิม"

วิธีย่อคือเทคนิคที่เรียกว่า distillation — ให้โมเดลใหญ่ทำหน้าที่เป็นครู แล้วให้โมเดลเล็กเรียนวิธีแก้ปัญหาตามจนซึมซับนิสัยที่ดีไว้ โดยไม่ต้องใช้ "สมอง" ขนาดเท่าเดิม จากนั้นทีมยังฝึกต่อด้วย reinforcement learning บนงาน coding อีกสองสัปดาห์ เหมือนซ้อมแล้วมีคนให้คะแนนทุกครั้งจนคมขึ้นเร็ว

02ตัวเลขที่ทำให้ต้องหยุดดู

บนการทดสอบ Humanity's Last Exam ตัว Inkling Small ทำได้ 31.6% แซงหน้า Inkling ตัวเต็มที่ 29.7% ด้วยซ้ำ ส่วนงานเขียนโค้ดบน SWE-Bench Verified ทะลุระดับ 80% และบนดัชนีรวมภายนอกอย่าง Artificial Analysis Intelligence Index ได้ 40 คะแนน ห่างจากรุ่นใหญ่ที่ได้ 41 เพียงแต้มเดียว พูดง่าย ๆ คือโมเดลขนาดราวหนึ่งในสี่ ไล่ตามตัวเต็มมาแบบหายใจรดต้นคอ

ของที่ติดมาในตัว

  • Open weights (Apache 2.0)

    ไม่ล็อกหลัง paywall หรือแอป ใครก็โหลดไปรันและต่อยอดได้ ภายในวันเดียวมีทั้ง vLLM และ SGLang รองรับ และชุมชนทำเวอร์ชันบีบอัด (GGUF) ให้เครื่องทั่วไปรันไหว

  • Multimodal ในสมองเดียว

    อ่านและให้เหตุผลจากข้อความ ภาพ และเสียงในโมเดลเดียว ซูมเข้าไปดูรายละเอียดในรูปหรือครอปกราฟมาพิจารณาระหว่างคิดได้

  • Context window 1 ล้าน token

    ป้อนเอกสารกองใหญ่หรือประวัติแชตยาว ๆ เข้าไปทีเดียว แล้วยังหาจุดที่ต้องการเจอ

  • จุดอ่อนที่ทีมบอกตรง ๆ

    Inkling ตัวใหญ่ยังชนะเรื่องความรู้ทั่วไปและความแม่นของข้อเท็จจริง ถ้าต้องการจำข้อมูลเป๊ะ ๆ รุ่นใหญ่ยังได้เปรียบ

03เกี่ยวอะไรกับเรา

สำหรับคนทำงานสายเทคนิค นี่คือโมเดล reasoning และ coding ระดับใกล้เรือธงที่เอามารันเองได้ฟรีในเครื่องหรือบนเซิร์ฟเวอร์ของตัวเอง เหมาะกับงานที่ไม่อยากส่งข้อมูลออกไปข้างนอก ฟันธง: **ควรลอง** ถ้าโจทย์คือ reasoning หรือเขียนโค้ด แต่ถ้าต้องการความแม่นเรื่องข้อเท็จจริงล้วน ๆ ให้เลือกรุ่นใหญ่หรือโมเดลปิดที่ถนัดด้านนั้นแทน

ที่น่าจับตายิ่งกว่าตัวโมเดลคือ "สูตร" — ปล่อยรุ่นยักษ์ก่อนเพื่อตั้งเพดาน แล้วรีบย่อเป็นรุ่นเล็กโดยใช้รุ่นยักษ์เป็นครู ทำได้ในสองสัปดาห์เพราะรู้ทางแล้ว ถ้าค่ายอื่นทำตาม ช่องว่างระหว่าง "AI ที่เก่งที่สุด" กับ "AI ที่เรารันเองได้" ก็จะแคบลงเรื่อย ๆ ใครหยิบของใหม่มาลองในสัปดาห์ที่มันออก ย่อมได้เปรียบคนที่รอไปอีกหลายเดือน

04จุดที่ต้องระวัง

การรัน weights เองต้องมีเครื่องและความรู้ระดับหนึ่ง ถ้าไม่ถนัดฝั่งโครงสร้าง แนะนำให้เข้าผ่านบริการอย่าง Tinker Playground หรือเครื่องมือที่สร้างครอบไว้ก่อน แล้วค่อยขยับไป self-host เมื่อพร้อม และอย่าลืมว่าเบนช์มาร์กเป็นภาพรวม งานจริงของเราควรทดสอบกับชุดงานของตัวเองก่อนเอาไปใช้ผลิตจริงเสมอ