GPT-5.6 SOL ปะทะ Claude Opus 5 — สองเรือธงคนละสไตล์ ที่สกอร์การ์ดวัดกันคนละสนาม
สารบัญ
สรุปให้ไว
SOL = สายลุย
เรือธงใหม่ของ OpenAI (GA 9 ก.ค.) เก่งงานโค้ดยาว ๆ agent workflow และการคุมเครื่องมือ มีโหมด Ultra ยิง 4 agent พร้อมกัน
Opus 5 = สายรอบคอบ
ของ Anthropic (24 ก.ค.) คิดเป็นค่าเริ่มต้น context 1M token และตรวจงานตัวเองโดยไม่ต้องสั่ง
กราฟเทียบกันไม่ได้ตรง ๆ
ตอน OpenAI โชว์กราฟ Opus 5 ยังไม่ออก เลยวัดกับ Fable 5 ส่วน Anthropic ก็วัดกับรุ่นตัวเอง
ฟันธง
เลือกตามงาน ไม่ใช่ตามคะแนน SOL ลุยยาว Opus 5 วางแผน+ตรวจ ใช้คู่กันได้ผลดีกว่าเลือกตัวเดียว
01สองตัวนี้คืออะไร
GPT-5.6 SOL คือเรือธงตัวใหม่ของ OpenAI เปิดใช้ทั่วไปวันที่ 9 กรกฎาคม มาเป็นครอบครัวสามรุ่น คือ SOL (ตัวท็อป), Terra (สมดุล) และ Luna (เร็ว) โดย SOL ถูกออกแบบมาสำหรับงานหนัก งานโค้ดยาว ๆ งาน agent การค้นคว้า การคุมคอมพิวเตอร์ และงานดีไซน์ มีสองสวิตช์ใหม่คือ Max (ให้เวลาคิดและตรวจแนวทางตัวเองมากขึ้น) และ Ultra (รัน 4 agent ขนานกันเป็นค่าเริ่มต้น เพื่อซอยงานใหญ่ให้เสร็จเร็วขึ้น)
Claude Opus 5 ออกวันที่ 24 กรกฎาคม Anthropic วางให้เป็นตัวที่หยิบใช้ทุกวันเพราะทำงานได้คุ้มพลังกว่ารุ่นอื่น ความฉลาดเข้าใกล้ Fable 5 ซึ่งเป็นตัวท็อปสุดของค่าย จุดเด่นคือคิดเป็นค่าเริ่มต้น มี context window 1 ล้าน token มีปุ่มปรับ "ระดับความพยายาม" (effort) ตั้งแต่ต่ำถึง max และที่สำคัญคือมันย้อนกลับไปตรวจงานตัวเองโดยไม่ต้องสั่ง
02ใครเก่งด้านไหน
ภาพรวมคือ SOL เป็นสายกัดไม่ปล่อย ดันงานไปเรื่อย ส่วน Opus 5 เป็นสายละเอียดรอบคอบ ทั้งคู่เก่งคนละมุม จุดที่ต้องระวังคือตัวเลข benchmark ของสองค่ายเทียบกันตรง ๆ ไม่ได้ เพราะตอน OpenAI เผยกราฟ Opus 5 ยังไม่คลอด SOL เลยถูกวัดกับ Claude Fable 5 ส่วนตอน Anthropic เผยกราฟก็วัดกับโมเดลของตัวเอง เอาบล็อกสองค่ายมาวางเทียบแล้วชี้ผู้ชนะจึงเหมือนดูมวยคนละคู่คนละวัน
SOL กับ Opus 5 เทียบจุดเด่น
- ★
GPT-5.6 SOL — งานลุยและความแม่น
ขึ้นอันดับต้น ๆ ของดัชนี coding agent (คะแนน 80), Terminal Bench 88.8% (เปิด Ultra ขยับไปเกือบ 92%), Browse Comp 90.4%, OS World 62.6%
- ★
GPT-5.6 SOL — programmatic tool calling
เขียนและรันโปรแกรมเล็ก ๆ ไปคุมเครื่องมือเอง เก็บเฉพาะผลที่จำเป็น ลดการวิ่งไป-กลับ งานที่ใช้เครื่องมือเยอะจึงเร็วขึ้นจริง
- ★
Claude Opus 5 — งานคิดและตรวจ
ขึ้นอันดับต้นของ Frontier Bench และ GDPVal, บน ARC-AGI-3 (โจทย์ใหม่ที่ไม่เคยเห็น) ทำได้ราว 3 เท่าของอันดับรอง, บน Zapier Automation Bench ผ่านงานธุรกิจครบจบราว 1.5 เท่าของอันดับรอง
- ★
Claude Opus 5 — คุมทีม agent
ประสาน sub-agent แบบ writer/verifier ได้ดี ไม่ค่อยแย่งกันแก้ไฟล์เดียวกัน อ่านชาร์ต/เอกสาร/ไดอะแกรมแม่นขึ้น และมี fast mode เร็วขึ้นราว 2.5 เท่า
03เกี่ยวอะไรกับเรา
ฟันธง: อย่าเลือกจากคะแนน ให้เลือกจากงาน ถ้าเป็นงานลุยยาว ๆ ปล่อยให้ทำเองนาน ๆ ให้ SOL คุม ถ้าเป็นงานวางแผน จัดโครง และตรวจทานให้เรียบร้อย ให้ Opus 5 คุม หลายคนใช้สองตัวคู่กัน — SOL ลงมือสร้าง Opus 5 วางแผนและรีวิว — แล้วได้ผลดีกว่าใช้ตัวเดียว
จุดที่คนพลาดกันบ่อยและควรจำไว้: (1) กับ Opus 5 อย่าใส่คำสั่งให้ "ตรวจงานตอนจบ" หรือให้ sub-agent มาเช็ก เพราะมันทำเองอยู่แล้ว prompt เก่าจากรุ่นก่อนจะทำให้มันตรวจซ้ำเกินจำเป็น ให้ลบทิ้ง (2) ใช้ปุ่ม effort ให้เป็น เริ่มที่ high แล้วค่อยลดถ้าคุณภาพยังนิ่ง ดันขึ้น max เฉพาะงานที่คุ้ม (3) อย่ารันสองโมเดลบนโฟลเดอร์โปรเจกต์เดียวกันพร้อมกัน เดี๋ยวทับงานตัวเอง (4) Opus 5 เขียนยาวและอธิบายเยอะกว่ารุ่นเดิม ถ้าอยากได้สั้นให้บอกตั้งแต่ต้น อย่าไปตัดทีหลัง