4 ปลั๊กอินฟรีที่โฆษณาว่าลด token ของ Claude Code 80% — ลองวัดจริงแล้วได้เท่าไร
สารบัญ
สรุปให้ไว
สี่เครื่องมือฟรี
RTK, Caveman, Ponytail, Omniroot แต่ละตัวลด token คนละจุด ตั้งแต่ output ของ shell ไปจนถึงความยาวโค้ด
โฆษณา 60-90%
เจ้าของเครื่องมือเคลมว่าลด token ได้ตั้งแต่ราว 60% ถึง 90%
ผลวัดจริงต่ำกว่ามาก
การทดสอบอิสระสำนักหนึ่งบนงาน agent จริงพบว่าประหยัดได้แค่เศษเสี้ยวของที่โฆษณา
ของฟรีที่ได้ผลชัวร์กว่า
นิสัยพื้นฐานอย่าง /clear, /compact และลดขนาด CLAUDE.md ให้ผลจริงโดยไม่ต้องติดตั้งอะไร
01เครื่องมือทำอะไรบ้าง
แนวคิดร่วมของทั้งชุดคือ "อุด token ที่รั่ว" ในการใช้ agent — ไม่ว่าจะเป็น output ยาว ๆ จากคำสั่ง shell คำตอบที่สุภาพเยิ่นเย้อ หรือโค้ดที่เขียนเกินจำเป็น แต่ละตัวจับคนละจุด
RTK (Rust Token Killer) เป็น proxy คั่นระหว่าง agent กับ shell มันเขียนคำสั่งใหม่ให้กระชับ กรอง output และตัดของซ้ำ ให้เหลือแต่สัญญาณสำคัญเข้า context ส่วน Caveman ทำให้คำตอบสั้นลงแบบพูดน้อยแต่ได้ใจความ ตัด filler ออก Ponytail ทำให้โมเดลเขียนโค้ดลีนลง โดยตัดเฉพาะส่วนเผื่ออนาคตที่ยังไม่จำเป็น ไม่ไปยุ่งกับ validation หรือ error handling และ Omniroot เป็น gateway ในเครื่องที่ส่งงานหยาบ ๆ ไปให้โมเดลฟรีหรือโลคอลทำแทนโมเดลตัวแพง
02แล้วมันลดได้จริงแค่ไหน
นี่คือส่วนที่ต้องอ่านให้ขาด เจ้าของเครื่องมือเคลมตัวเลขสวย เช่น RTK ราว 60-90%, Caveman ราว 65%, Ponytail ราว 54% แต่ผลทดสอบอิสระสำนักหนึ่งที่วัดบนงาน agent จริงกลับได้ตัวเลขต่ำกว่ามาก — RTK แทบไม่ต่าง (บางกรณีแพงขึ้นด้วยซ้ำในงานที่ใช้ reasoning ต่ำ), Caveman ราว 8.5% และ Ponytail ราว 10%
เหตุผลสมเหตุสมผล: output ของงาน agent ส่วนใหญ่คือโค้ด diff การเรียกเครื่องมือ และข้อความ error แบบเป๊ะ ๆ ซึ่งเครื่องมือพวกนี้ปล่อยไว้เหมือนเดิมอย่างถูกต้อง ที่บีบได้จริงคือคำบรรยายระหว่างขั้นตอนซึ่งเป็นส่วนน้อย ตัวเลขที่โฆษณามักวัดจากสถานการณ์ที่เอื้อที่สุด ไม่ใช่งานจริง
สรุปแต่ละตัว เคลมเทียบผลวัดจริง
- ★
RTK
เคลมลด output ของ shell 60-90% แต่วัดจริงบนงาน agent แทบไม่ต่าง ค่า overhead ราว 14 มิลลิวินาที
- ★
Caveman
เคลมลด output ราว 65% วัดจริงราว 8.5% เพราะบีบได้แค่ส่วนบรรยาย (repo: github.com/juliusbrussee/caveman)
- ★
Ponytail
เคลมลดโค้ดราว 54% วัดจริงลดต้นทุนราว 10% เป็นตัวที่มีสัญญาณประหยัดชัดสุดในชุด
- ★
Omniroot
gateway ส่งงานหยาบไปโมเดลฟรีหรือโลคอล มี RTK และ Caveman ฝังในตัว ช่วยเลี่ยงการโดนจำกัดอัตราของโมเดลฟรี
03เกี่ยวอะไรกับเรา
นี่คือกรณีคลาสสิกของ "อย่าเชื่อตัวเลขบนหน้า README จนกว่าจะวัดเอง" เครื่องมือพวกนี้ฟรีและความเสี่ยงต่ำ ฟันธง: **ลองได้** แต่ **ต้องวัด token ก่อนและหลังกับงานจริงของคุณเอง** ไม่ใช่เชื่อเลข 80-90% ที่โฆษณา ถ้าอยากได้ผลชัวร์โดยไม่ต้องติดตั้งอะไร ให้เริ่มจากนิสัยพื้นฐาน: สั่ง /clear เมื่อจบงาน, /compact เมื่อคุยยาว, ลดขนาดไฟล์ CLAUDE.md, จัด routing งานยากไปโมเดลเก่ง งานง่ายไปโมเดลถูก และใช้ sub-agent แบบ scout ที่เผา context ตัวเองแล้วรายงานกลับมาแค่ข้อสรุป
ต่อยอดในทีม: ตั้งชั้นความจำให้ agent อ่าน context จากที่เดียว จะได้ไม่ต้องลาก context เดิมกลับมาซ้ำทุกเซสชัน ซึ่งเป็นต้นตอ token บวมที่ใหญ่กว่าที่หลายคนคิด