หน้าโปรเจกต์ jevgrep เขียนตัวใหญ่ไว้ว่า Same intelligence. ~30% lower cost. หมายถึงทำ SWE-bench ได้ 8 เต็ม 10 ข้อเท่า baseline แต่ต้นทุน agent ต่ำกว่า เราเปิดไฟล์ผลวัดดูแล้ว ตัวเลขจริงคือประหยัด 28.6 เปอร์เซ็นต์ (5.44 ดอลลาร์เทียบกับ 7.62 ดอลลาร์ ไม่รวมค่า Jev) และรันซ้ำแบบรวมค่า Jev แล้วยังประหยัด 25.8 เปอร์เซ็นต์
เงินที่ประหยัดกระจุกตัว
ตารางราย task เผยสิ่งที่พาดหัวไม่ได้บอก ข้อ pytest ข้อเดียวชนะขาด (0.53 เทียบกับ 2.34 ดอลลาร์) จนดึงตัวเลขรวมทั้งก้อน ขณะที่หลายข้อแพงกว่าเดิม เช่น xarray requests และ astropy
แปลว่าไม่ได้ประหยัดสม่ำเสมอทุกงาน งานค้นเล็กๆ อาจแพงกว่าใช้วิธีเดิม
เงื่อนไขที่เจ้าของเขียนไว้เอง
ต้องให้เครดิตว่าเจ้าของโปรเจกต์เขียนข้อจำกัดไว้ตรงๆ ในไฟล์ผลวัด ว่าวัด task เดียวต่อข้อ ไม่ใช่ holdout ไม่พิสูจน์ causal effect ไม่พิสูจน์ว่าประหยัดทุกภาษาทุก repo และ baseline เก่าไม่ได้รันซ้ำ โปรเจกต์อายุสองสัปดาห์ มี stars กว่า 2500 ดวง และ license เป็น MIT
บันไดเครื่องมือค้นโค้ด
| เครื่องมือ | หาอะไร | ข้อแลก |
|---|---|---|
| rg/grep | คำตรงตัว | เร็วและฟรี แต่ไม่เข้าใจความหมาย |
| ast-grep | โครงสร้างโค้ด | เร็วและฟรี แต่ต้องเขียน pattern เอง |
| jevgrep | ความหมาย/พฤติกรรม | ถามภาษาคนได้ แต่เสียค่า model ทุกครั้ง |
เทียบจากเอกสารและการทดลองของเราเอง ข้อสรุปคืองานหาคำตรงตัวใช้ grep งาน refactor ตามโครงสร้างใช้ ast-grep ส่วนงานสำรวจ repo ใหญ่ที่ไม่คุ้นค่อยเรียก jevgrep เครื่องมือไม่ได้แทนกัน แต่อยู่คนละขั้นบันได
บทสรุปของซีรีส์นี้
jevgrep ไม่ใช่ของวิเศษ แต่เป็นของที่วัดผลตรงไปตรงมา ทั้งตัวเลขที่ดีกับข้อจำกัดที่เขียนไว้เอง และการทดลองของเราก็ยืนยันว่า คำถามแคบมันแม่น ส่วนคำถามกว้างยังต้องอ่านต่อเอง
ถ้าจะเอาไปใช้ ให้เริ่มจากงาน discovery ข้ามไฟล์ใน repo ใหญ่ นั่นคือจุดที่มันชนะเครื่องมือเดิมชัดที่สุดตามหลักฐาน