ข่าวลือที่ได้ยินมาถูกครึ่งเดียว การใช้ Muse Code ให้มีประสิทธิภาพไม่ต้องการ prompt ที่คมกว่า แต่ต้องการ loop engineering คือการออกแบบวงจรให้ agent กระทำ สังเกต ตัดสินใจ แล้ววนจนบรรลุเป้าหมาย โดยคนเปลี่ยนบทบาทจากคนเขียน prompt ทุกขั้น มาเป็นคนออกแบบระบบที่กำกับ agent บทความนี้เล่าที่มากรอบคิด และเอามาทบทวนงานของเราตรงๆ

ที่มา: 3 loops ของ Andrew Ng

Andrew Ng เขียนไว้ใน The Batch ว่ามี 3 วงจร คือ agentic coding loop (agent เขียน ทดสอบ วนจนตรง spec ระดับนาที) developer feedback loop (คนตรวจแล้ว steer ระดับสิบนาทีถึงชั่วโมง) และ external feedback loop (feedback ผู้ใช้จริง ระดับชั่วโมงถึงวัน) ส่วน IBM นิยามขั้นตอนใน loop ไว้เป็น Goal → Action → Observation → Adjustment ใจความเดียวกันคือ prompt เหมาะกับงานครั้งเดียว ส่วน loop เหมาะกับงานยาว

กับดัก: loop ที่จบไม่เป็น

Ng ย้ำเงื่อนไขที่คนมองข้ามสองข้อ ข้อแรกคือ loop ต้องมี evals (ชุดวัด) กับ stopping criteria ที่ตรวจได้จริง ไม่เช่นนั้นจะวนเผา token ไม่รู้จบ ข้อที่สองคือคนยังมี context advantage คือรู้เรื่องผู้ใช้มากกว่าที่ AI รู้ ทำให้ human-in-the-loop ยังจำเป็น ไม่ใช่เพราะ AI ไม่เก่ง แต่เพราะมันไม่รู้ในสิ่งที่มันไม่รู้

ทบทวนงานบล็อกนี้ด้วยกรอบนี้

Agentic loop ของเราแข็ง ทุกงานเดินเป็นวงจร build → curl ตรวจ → แก้ที่สาเหตุ → deploy → verify ดูได้จาก CHANGES.log ทั้ง session เกณฑ์หยุดชัด (build ผ่าน หน้า 200 ตารางขึ้น) ไม่เคยสั่งครั้งเดียวแล้วจบ

Developer loop ทำงานจริง ผู้ใช้ติงมา 4 รอบ (เนื้อหา ANA ผิดประเด็น landing จืด ประโยคขาด ตารางไม่ขึ้น) ทุกรอบกลายเป็นงานแก้ที่มีหลักฐาน verify นี่คือ loop ที่ Ng ว่าสำคัญที่สุด เพราะมันเติม context ที่ AI ไม่มี

External loop เพิ่งเริ่ม บล็อกเปิด public แล้ว แต่ยังไม่มีช่องรับ feedback จากผู้อ่าน นอกจากบทสนทนานี้ นี่คือวงจรที่รั่วที่สุดของเรา

สิ่งที่ขาดคือ evals จริงจัง เกณฑ์หยุดของเราวัดแค่ว่า "รันได้" ไม่ได้วัดว่า "อ่านรู้เรื่อง" การทบทวนภาษารอบก่อนอาศัยตาคนล้วนๆ ขั้นต่อไปควรมีเช็กลิสต์ภาษาเป็น eval ประจำ (ซึ่งเริ่มมีใน PLAYBOOK แล้ว) กับการสุ่มตรวจบทความเก่าทุกครั้งที่ลงบทความใหม่

สรุป

loop engineering ไม่ใช่เวทมนตร์ แต่คือวินัยสามข้อ spec ชัด เกณฑ์หยุดชัด และคนอยู่ในวงจร งานของเราสอบผ่านสองข้อแรกในระดับงานช่าง แต่ข้อ external feedback กับ evals ด้านภาษายังต้องสร้างต่อ บทความนี้เองก็คือหนึ่งใน evals นั้น