Liquid AI ปล่อย LFM2.5-2.6B โมเดลจิ๋วที่ฝึกมาให้ทำงานเป็น agent บนเครื่องตัวเอง
สารบัญ
สรุปให้ไว
เล็กจนรันบนมือถือได้
2.6B พารามิเตอร์ กินแรมไม่ถึง 2.5GB วิ่งได้ทั้งบนแล็ปท็อปและโทรศัพท์
ฝึกมาเป็น agent โดยเฉพาะ
เทรนให้เรียกเครื่องมือและทำงานหลาย step ไม่ใช่แค่ตอบข้อความ
เร็วจริง
ราว 220 token ต่อวินาทีบนแล็ปท็อป Apple แรง ๆ และราว 30 ต่อวินาทีบนมือถือ
เปิดน้ำหนัก
โหลดใช้ได้จาก Hugging Face รองรับ llama.cpp, MLX, vLLM, SGLang, ONNX ตั้งแต่วันแรก
01มันคืออะไร
LFM2.5-2.6B คือโมเดลภาษาขนาดเล็กจาก Liquid AI ที่ตั้งใจให้รันบนเครื่องของผู้ใช้เองแบบไม่ต้องพึ่งคลาวด์ ตัวเลข 2.6B คือจำนวนพารามิเตอร์ ซึ่งจัดว่าเล็กมากเมื่อเทียบกับโมเดลก้อนใหญ่ในคลาวด์ ความเล็กนี้แลกมาด้วยข้อดีที่คนทำงานสายข้อมูลอ่อนไหวชอบ นั่นคือข้อมูลไม่ต้องออกจากเครื่อง มันมี context window ขนาด 128k token และถูกปล่อยเป็นโมเดลเปิดน้ำหนักบน Hugging Face ทั้งรุ่น base และรุ่นที่ผ่านการปรับแต่งเพิ่ม
02จุดต่างจากโมเดลจิ๋วทั่วไป
โมเดลเล็กส่วนใหญ่มีปัญหาเดิม ๆ คือเล็กแล้วโง่ หรือเรียกเครื่องมือไม่เป็น สิ่งที่ Liquid เคลมว่าต่างคือกระบวนการฝึก พวกเขาเทรนบนข้อมูลราว 34 ล้านล้าน token แล้วปรับต่ออีกหลายรอบ เริ่มจากสอนกว้าง ๆ ก่อน แล้วค่อยบีบให้เชี่ยวงานแบบ agent จากนั้นสร้างเวอร์ชันผู้เชี่ยวชาญเฉพาะทางหลายตัวแล้วหลอมความรู้กลับเข้ามาในโมเดลเดียว ขั้นสุดท้ายคือปล่อยให้มันทำงานจริงในสภาพแวดล้อม agent แล้วให้รางวัลเมื่อทำงานหลาย step จนจบ ไม่ใช่แค่เดาคำถัดไปถูก ขั้นนี้แหละที่ทำให้มันเรียกเครื่องมือและทำตามคำสั่งได้ดีกว่าโมเดลเล็กที่ฝึกแบบเดิม
สเปกที่ควรรู้
- ★
ขนาดและหน่วยความจำ
2.6B พารามิเตอร์ ใช้แรมไม่ถึง 2.5GB ตลอดการทำงาน
- ★
ความเร็ว
ราว 220 token/วินาทีบนแล็ปท็อป Apple แรง ๆ และยังราว 30 token/วินาทีบนมือถือ
- ★
คอนเทกซ์
128k token พอสำหรับงานเอกสารและงานต่อเนื่องหลายรอบ
- ★
รองรับตั้งแต่วันแรก
llama.cpp, MLX, vLLM, SGLang, ONNX ครอบคลุมทั้งการรันบนเครื่องและบนเซิร์ฟเวอร์
03เกี่ยวอะไรกับเรา
ฟันธง: ควรลอง ถ้าคุณอยากได้ผู้ช่วย AI ที่ทำงานเบื้องหลังได้โดยข้อมูลไม่หลุดออกจากเครื่อง เช่น อ่านโน้ตงานภายใน สรุปไฟล์ หรือเป็นตัวจักรเล็ก ๆ ในระบบ agent ที่เรียกใช้บ่อย ๆ จุดแข็งจริงคือมันเบาพอจะเปิดค้างไว้ทั้งวันโดยไม่ทำให้เครื่องอืด เลยเหมาะเป็น "คนงานประจำเครื่อง" ที่รับงานปริมาณมากราคาศูนย์บาทต่อครั้ง แต่อย่าคาดหวังว่ามันจะฉลาดเท่าโมเดลคลาวด์ก้อนโต งานที่ต้องเหตุผลลึกหรือความแม่นสูงควรส่งต่อให้รุ่นใหญ่ วิธีที่คุ้มคือจับมันไว้ในชั้นแรกของ workflow ให้กรองและเตรียมงาน แล้วให้คนหรือโมเดลใหญ่ตรวจในจุดสำคัญ โดยเฉพาะงานที่เกี่ยวกับไฟล์บริษัทหรือข้อมูลลูกค้า
โปรเจกต์ open-source
อยากลองเองไหม? โปรเจกต์นี้เป็น open-source โหลด repo ทางการมาลองได้เลย
ดูบน Hugging Face → →