ปัญหาของ AI research agent ไม่ใช่ค้นไม่เก่ง แต่คือค้นแล้วลืม ต้องเริ่มใหม่ซ้ำทุกครั้ง แนวคิด LLM Wiki เสนอทางออกที่เรียบง่าย คือทุกครั้งที่ AI ทำงาน ให้มันทิ้งองค์ความรู้ที่นำกลับมาใช้ซ้ำได้ไว้ด้วย ไม่ใช่ทิ้งแค่คำตอบในแชต
ข้อควรทราบก่อนอ่าน: โครงและคำอธิบายในภาพโน้ตต้นทางระบุชัดว่าเป็นการตีความจากบันทึกสาธารณะของ Andrej Karpathy ไม่ได้เขียนหรือรับรองโดยตัวเขาเอง ส่วนแนวคิดต้นฉบับอยู่ใน gist LLM Wiki ของ Karpathy ซึ่งเราเปิดอ่านเองแล้ว บทความนี้อ้างจาก gist นั้นเป็นหลัก
สรุปสำหรับผู้บริหาร
- ปัญหาของ AI research agent คือค้นแล้วลืม ต้องเริ่มใหม่ซ้ำทุกครั้ง ไม่ใช่ค้นไม่เก่ง
- LLM Wiki ให้ AI สร้างวิกิถาวรที่สะสมความรู้ไว้ ทุกครั้งที่ทำงานต้องทิ้งของที่ใช้ซ้ำได้ ไม่ใช่แค่คำตอบ
- สถาปัตยกรรมมีสามชั้นคือแหล่งต้นฉบับ วิกิ และสคีมา วงจรมีสามแบบคือ ingest query และ lint
- เราหยิบมาใช้แล้วสามข้อ CHANGES.log ทำหน้าที่ log ตอบผ่านวิกิก่อน และเก็บคำตอบดีๆ กลับเข้าคลัง
ใจความสำคัญ
ประสบการณ์ใช้ LLM กับเอกสารแบบทั่วไปคือ RAG คืออัปโหลดไฟล์ ให้โมเดลดึงส่วนที่เกี่ยวมาตอบ แล้วจบ วิธีนี้ใช้ได้ แต่โมเดลต้องค้นพบความรู้ใหม่ตั้งแต่ต้นทุกครั้งที่ถาม ไม่มีอะไรสะสม คำถามที่ต้องสังเคราะห์จากเอกสารห้าฉบับก็ต้องปะติดปะต่อใหม่ทุกรอบ
LLM Wiki กลับด้านวิธีคิด แทนที่จะดึงเอกสารดิบมาตอบทุกครั้ง ให้ LLM สร้างและดูแลวิกิถาวรที่อยู่ตรงกลางระหว่างเรากับแหล่งต้นฉบับ เมื่อมีแหล่งข้อมูลใหม่เข้ามา มันไม่อัปเดตแค่ดัชนีค้นหา แต่อ่าน สกัดสาระ แล้วรวมเข้าวิกิเดิม อัปเดตหน้าหัวข้อ แก้ข้อสรุป บันทึกจุดที่ข้อมูลใหม่ขัดกับของเก่า ความรู้จึงถูกคอมไพล์ครั้งเดียวแล้วดูแลให้ทันสมัย ไม่ต้องสกัดใหม่ทุกคำถาม
ประโยคที่เป็นหัวใจของแนวคิดคือ วิกิเป็นสิ่งที่สะสมมูลค่าได้ การเชื่อมโยงอยู่แล้ว ข้อขัดแย้งถูกชี้ไว้แล้ว ข้อสังเคราะห์สะท้อนทุกสิ่งที่อ่านมาแล้ว ยิ่งใส่แหล่งข้อมูลและยิ่งถาม วิกิยิ่งรวยขึ้น
สามชั้นของระบบ
สถาปัตยกรรมมีสามชั้น ชั้นแรกคือแหล่งต้นฉบับ เช่น บทความ งานวิจัย ภาพ ไฟล์ข้อมูล ชั้นนี้เปลี่ยนไม่ได้ LLM อ่านได้อย่างเดียว ห้ามแก้ นี่คือแหล่งความจริง
ชั้นที่สองคือวิกิ เป็นไดเรกทอรีของไฟล์มาร์กดาวน์ที่ LLM สร้างและเป็นเจ้าของทั้งหมด มีทั้งสรุป หน้าบุคคล หน้าแนวคิด หน้าวิเคราะห์ และหน้าสังเคราะห์ เราเป็นคนอ่าน LLM เป็นคนเขียน เมื่อมีแหล่งข้อมูลใหม่มันจะแตะหลายหน้าในรอบเดียว
ชั้นที่สามคือสคีมา เป็นเอกสารกติกาที่บอก LLM ว่าวิกิจัดโครงอย่างไร ธรรมเนียมการเขียนเป็นแบบไหน และขั้นตอนทำงานเมื่อรับแหล่งข้อมูลใหม่ ตอบคำถาม หรือบำรุงวิกิคืออะไร ตัวอย่างที่ gist ยกมาคือไฟล์อย่าง CLAUDE.md หรือ AGENTS.md จุดนี้คือสิ่งที่เปลี่ยน LLM จากแชตบอตทั่วไปให้เป็นผู้ดูแลวิกิที่มีวินัย และเราต้องปรับมันร่วมกันไปเรื่อย ๆ ตามหน้างานจริง
| ประเด็น | RAG ทั่วไป | LLM Wiki |
|---|---|---|
| วิธีตอบ | ดึงชิ้นเอกสารดิบมาตอบทุกครั้ง | ตอบผ่านวิกิที่สังเคราะห์ไว้แล้ว |
| สิ่งที่เหลือหลังงาน | เหลือแค่บทสนทนา | เหลือวิกิที่รวยขึ้น |
| ข้อขัดแย้งของข้อมูล | เจอใหม่ทุกครั้ง | ถูกบันทึกไว้ตั้งแต่รอบที่เจอ |
| ต้นทุนรอบที่สิบ | เท่ารอบแรก | ถูกลงเพราะสังเคราะห์แล้ว |
ภาพรวมของสามชั้นอยู่ตรงนี้ จำง่าย ๆ ว่าล่างสุดแตะไม่ได้ ตรงกลางสะสม บนสุดคุมกติกา
วงจรทำงานสามแบบ
gist แบ่งงานเป็นสามวงจร วงจรแรกคือ ingest รับแหล่งข้อมูลใหม่เข้ามา ขั้นตอนตัวอย่างคือ LLM อ่านแหล่งข้อมูล คุยสาระสำคัญกับเรา เขียนหน้าสรุป อัปเดตดัชนี อัปเดตหน้าที่เกี่ยวทั้งวิกิ แล้วลงบันทึก แหล่งข้อมูลเดียวอาจแตะสิบกว่าหน้า เจ้าของไอเดียแนะนำให้ ingest ทีละชิ้นและมีส่วนร่วม ตรวจสรุป ชี้นำว่าอะไรสำคัญ แล้วจดขั้นตอนที่เหมาะกับตัวเองไว้ในสคีมา
วงจรที่สองคือ query ถามผ่านวิกิ LLM ค้นหน้าที่เกี่ยว อ่าน แล้วสังเคราะห์คำตอบพร้อมอ้างอิง ประเด็นสำคัญคือคำตอบที่ดีควรถูกเก็บกลับเข้าวิกิเป็นหน้าใหม่ด้วย ตารางเปรียบเทียบที่เราขอ บทวิเคราะห์ที่เพิ่งค้นพบ ไม่ควรหายไปกับประวัติแชต
วงจรที่สามคือ lint ตรวจสุขภาพวิกิเป็นระยะ มองหาหน้าที่ขัดกัน ข้ออ้างเก่าที่ข้อมูลใหม่ล้มไปแล้ว หน้าลูกกำพร้าที่ไม่มีลิงก์เข้า แนวคิดสำคัญที่ถูกเอ่ยถึงแต่ยังไม่มีหน้าเป็นของตัวเอง และช่องว่างที่ควรค้นเพิ่ม
ภาพรวมของสามวงจรที่หมุนรอบวิกิอยู่ตรงนี้
สองไฟล์พิเศษช่วยนำทางวิกิ ไฟล์แรกคือ index.md เป็นสารบัญเชิงเนื้อหา ทุกหน้ามีลิงก์กับสรุปหนึ่งบรรทัด LLM อ่านไฟล์นี้ก่อนเมื่อตอบคำถาม ที่ขนาดปานกลางราวร้อยแหล่งข้อมูลกับหลายร้อยหน้าวิธีนี้ก็ยังเวิร์กโดยไม่ต้องมีโครงค้นหาแบบเวกเตอร์ ไฟล์ที่สองคือ log.md เป็นบันทึกตามเวลาแบบต่อท้ายอย่างเดียว ถ้าทุกรายการขึ้นต้นด้วยรูปแบบคงที่อย่าง ## [2026-04-02] ingest | ชื่อเรื่อง ก็ grep ดูประวัติได้ด้วยคำสั่งยูนิกซ์ธรรมดา
เราหยิบอะไรมาใช้กับบล็อกนี้
ข่าวดีคือบล็อกนี้มีสามชั้นนี้อยู่แล้วเกือบครบ แหล่งต้นฉบับคือไฟล์ทักษะ เอกสารทางการ ผลวัด และบันทึกเซสชัน ชั้นวิกิคือบทความใน content/ ที่สังเคราะห์แล้วนำกลับมาใช้ซ้ำได้ ชั้นสคีมาคือ AGENTS.md กับ PLAYBOOK.md และ TEMPLATE.md ที่คุมวิธีเขียน วิธีตรวจ และวิธเผยแพร่
สิ่งที่เราหยิบมาใช้จริงมีสามข้อ ข้อแรกคือบันทึก CHANGES.log ทำหน้าที่เดียวกับ log.md ของ gist อยู่แล้ว เป็นรายการต่อท้ายตามเวลา มีชื่อผู้ทำ Changed กับ Next ทุกครั้ง ทำให้ย้อนได้ว่าใครแตะอะไรและขั้นต่อไปคืออะไร ข้อที่สองคือกฎตอบผ่านวิกิก่อน คำถามที่เคยตอบแล้วต้องไปเปิดบทความเดิมก่อน ไม่เริ่มค้นใหม่ แล้วค่อยกลับไปหาแหล่งดิบเฉพาะส่วนที่ขาด ข้อที่สามคือเก็บคำตอบดี ๆ กลับเข้าคลัง บทวิเคราะห์ที่เคยเป็นแค่คำตอบในแชต ถ้ามีคุณค่าพอต้องกลายเป็นหน้าบทความหรือส่วนของบทความ ไม่ปล่อยให้หายไป
ส่วนที่ยังไม่ทำและไม่ควรรีบทำคือเครื่องมือค้นเฉพาะกับปลั๊กอิน Obsidian อย่าง Dataview หรือ Marp ที่ gist แนะนำ ที่ขนาดสิบกว่าบทความ สารบัญกับ grep ธรรมดายังพอ อีกอย่างที่ต้องซื่อสัตย์คือวิธีนี้ไม่ได้แก้ปัญหาหลักฐานผิดตั้งแต่ต้น ถ้าแหล่งต้นฉบับผิด วิกิก็จะผิดอย่างเป็นระบบ วิธีกันคือข้อที่ gist ย้ำไว้ คือแยกข้อเท็จจริงออกจากข้อเดา ทุกข้ออ้างสำคัญต้องผูกกับแหล่งที่มา และบันทึกความไม่แน่ใจไว้แทนที่จะเกลี่ยให้เรียบ
สรุปชวนใช้
ประโยคที่คมที่สุดของแนวคิดนี้คือ อย่าพยายามทำให้ AI จำทุกอย่างเก่งขึ้น แต่จงออกแบบให้ AI สร้างสิ่งที่ควรค่าแก่การจดจำ AI ที่ดีไม่ควรแค่ตอบคำถามวันนี้ได้ แต่ควรทำให้งานครั้งต่อไปฉลาดขึ้น มีหลักฐานรองรับมากขึ้น และเสียเวลาทำซ้ำน้อยลง
ถ้าจะเริ่ม ให้เริ่มเล็กแบบ gist แนะนำ คือตั้งไดเรกทอรีสามส่วนคือแหล่งดิบ วิกิ และสคีมา เขียนสคีมาสั้น ๆ หนึ่งหน้าว่า ingest ถาม และ lint ทำอย่างไร แล้วให้ LLM ช่วยปรับมันไปพร้อมกัน เป้าหมายหลังผ่านไปยี่สิบรอบไม่ใช่แชตยี่สิบห้อง แต่คือฐานความรู้เดียวที่ดีกว่าวันแรกอย่างเห็นได้ชัด