Call Me Thanut
puzzleOpen Source

Poolside เปิด Laguna S 2.1 — โมเดลโค้ดโอเพนเวท 118B ที่ปลุกแค่ 8B ต่อครั้ง แต่สู้โมเดลใหญ่กว่าหลายเท่า

23 ก.ค. 2026อ่าน 5 นาที
Poolside เปิด Laguna S 2.1 — โมเดลโค้ดโอเพนเวท 118B ที่ปลุกแค่ 8B ต่อครั้ง แต่สู้โมเดลใหญ่กว่าหลายเท่า
สารบัญ

สรุปให้ไว

โอเพนเวทสายโค้ด

Poolside ปล่อย Laguna S 2.1 ให้โหลด weights ไปรันเองได้ ออกแบบมาเพื่องาน agent เขียนโค้ดโดยเฉพาะ

เล็กแต่แรง

MoE 118B พารามิเตอร์รวม แต่เปิดใช้จริงแค่ราว 8B ต่อ token จึงถูกและเร็วกว่าโมเดลขนาดเท่ากัน

context ยาว

รองรับได้ถึง 1 ล้าน token (ที่พบบ่อยคือ 256k) พออ่านทั้ง codebase ได้ในรอบเดียว

ตัวเลขจริง

ทำคะแนนสาย SWE/terminal สูสีหรือแซงโมเดลที่ active parameter มากกว่าหลายเท่า

01Laguna S 2.1 คืออะไร

Laguna S 2.1 คือโมเดลภาษาโอเพนเวทจาก Poolside แล็บ AI ในซานฟรานซิสโก ที่สร้างมาเพื่องานวิศวกรรมซอฟต์แวร์โดยเฉพาะ ไม่ใช่แชตบอตทั่วไปที่บังเอิญเขียนโค้ดได้ แต่ตั้งใจจูนมาสำหรับ agent ที่ต้องเรียกใช้ tool ทำงานผ่าน terminal และคิดเป็นสเต็ปยาว ๆ

จุดที่ทำให้คนพูดถึงคือ "โอเพนเวท" หมายความว่าใครก็โหลดตัวโมเดลไปรันบนเครื่องตัวเองได้ ไม่ต้องจ่ายค่าเช่าเซิร์ฟเวอร์ของใคร Poolside ยังเปิด trajectory เต็ม ๆ ให้ดูว่าโมเดลแก้โจทย์แต่ละข้อไปยังไงทีละสเต็ป ซึ่งเป็นความโปร่งใสที่หาได้ไม่บ่อยในวงการ

02เล็กแต่แรง เพราะสถาปัตยกรรม Mixture-of-Experts

หัวใจของความคุ้มคือสถาปัตยกรรมแบบ Mixture-of-Experts (MoE) นึกภาพโรงพยาบาลที่มีหมอเฉพาะทาง 118 คนยืนรออยู่ แต่คนไข้แต่ละเคสเรียกใช้แค่ 2-3 คนที่ตรงงาน ที่เหลือ standby เอาไว้ Laguna ก็ทำงานแบบนั้น มีพารามิเตอร์รวม 118 พันล้าน แต่แต่ละ token วิ่งผ่านแค่ราว 8 พันล้าน (ประมาณ 6.8% ของทั้งหมด) ทำให้ได้ความฉลาดใกล้โมเดลใหญ่ แต่ต้นทุนรันต่ำและเร็วกว่ามาก

Poolside รายงานผลเบนช์มาร์กสายโค้ดที่น่าสนใจ และเทียบกับคู่แข่งที่ active parameter มากกว่าหลายเท่าก็ยังยืนได้ ต่อไปนี้คือตัวเลขหลักที่เขาเปิดเผย

ผลเบนช์มาร์กที่ Poolside เปิดเผย

  • Terminal Bench 2.1 ~70.2%

    วัดความสามารถทำงานจริงบน command line ระดับต้น ๆ ของกลุ่มโมเดลโค้ด

  • SWE Bench Multilingual 78.5%

    งานแก้บั๊กจริงข้ามหลายภาษาโปรแกรม

  • SWE Bench Pro 59.4%

    ชุดโจทย์วิศวกรรมซอฟต์แวร์ที่ยากขึ้น

  • Deep SWE 40.4%

    งานสาย autonomous ที่ต้องวางแผนหลายสเต็ป

  • รันบนเครื่องเดียวได้

    เล็กพอจะรันบนเครื่องระดับ NVIDIA DGX Spark เครื่องเดียว

03ทำอะไรได้จริง

Poolside โชว์เดโมที่จับต้องได้ เช่น ให้โฟลเดอร์เปล่ากับโจทย์ "สร้าง rendering engine ของ HTML/CSS จากศูนย์" โมเดลไล่ทำ 181 สเต็ปในเวลาราว 50 นาที และถึงขั้นเปิด Chrome แบบ headless ขึ้นมาตรวจงานตัวเองระหว่างทาง อีกเทสต์คือปล่อยให้ไปแตะโค้ดจริงภายในของ Poolside เอง ผลคือทำให้โค้ดรันเร็วขึ้น 5.2% และใช้หน่วยความจำน้อยลงราว 70%

โมเดลมีสองโหมด คือ thinking ที่หยุดคิดเป็นสเต็ปก่อนตอบ เหมาะกับงานยาก และ no-thinking ที่ตอบไวสำหรับงานง่าย ก่อนหน้านี้ราวสามสัปดาห์ Poolside เพิ่งปล่อยรุ่นน้อง Laguna XS ที่ออกแบบให้รันบนเครื่องเดียวแบบเบา ๆ และเจ้าตัวบอกว่าตั้งใจปล่อยโมเดลใหม่ราวทุก 5 สัปดาห์ ซึ่งถือว่าเร็วมากสำหรับการทำ foundation model

04เกี่ยวอะไรกับเรา

ฟันธง: ถ้าทีมมีเครื่องแรงพอและอยากได้ผู้ช่วยเขียนโค้ดที่ "เป็นของเราเอง" ไม่ผูกกับค่าเช่า API รายเดือน Laguna S 2.1 คือของที่ควรลองจริง จุดขายไม่ใช่แค่ฟรี แต่คือ context ยาวพออ่านทั้งโปรเจกต์ และต้นทุนรันต่ำเพราะ active parameter น้อย เหมาะกับงานที่ต้องปล่อย agent รันยาว ๆ ทั้งวันโดยไม่ต้องกลัวบิลบาน

ข้อควรระวังตามสไตล์คนทำงานจริง: เบนช์มาร์กเป็นตัวเลขที่แล็บรายงานเอง ของจริงต้องเอามาเทสต์กับงานในมือก่อนตัดสิน และการรันโอเพนเวทเองมีงาน setup มากกว่าเครื่องมือสำเร็จรูปแบบ hosted อยู่พอสมควร แนะนำให้เริ่มจากงานที่ตรวจผลได้ชัด เช่น เขียนสคริปต์ ทำ landing page ภายใน แล้วค่อยขยับไปงานที่เสี่ยงขึ้น โดยยังคง Human Gate ตรวจโค้ดก่อน merge เสมอ อย่าปล่อยให้ agent push ขึ้น production เอง

โปรเจกต์ open-source

อยากลองเองไหม? โปรเจกต์นี้เป็น open-source โหลด repo ทางการมาลองได้เลย

ดูบน Hugging Face →