ระบบ RAG ที่ใช้งานได้จริง: จากฐานความรู้สู่การสร้างข้อมูลที่ได้รับการเสริมจากข้อมูล
โน้ตการบรรยายสำหรับนักศึกษาเหล่านี้ให้มุมมองในระดับระบบเกี่ยวกับการสร้างระบบการสร้างข้อมูลที่ได้รับการเสริมจากข้อมูล (RAG) ที่ใช้งานได้จริง หลักสูตรครอบคลุมกระบวนการทั้งหมดตั้งแต่การนำเข้าข้อมูล การแบ่งข้อมูลเป็นชิ้นเล็ก ๆ กลยุทธ์การจัดกลุ่ม การแปลงเวกเตอร์ การจัดเก็บเวกเตอร์ การค้นหาแบบไฮบริด การจัดลำดับใหม่ และการประเมินผลเพื่อแอปพลิเคชันปัญญาประดิษฐ์ที่เชื่อถือได้
ภาพรวมคอร์สเรียน
สรุปเนื้อหา
โน้ตการเรียนของนักศึกษาเหล่านี้ให้มุมมองในระดับระบบเกี่ยวกับการสร้างระบบที่ใช้งานได้จริงสำหรับระบบการสร้างข้อมูลเสริม (Retrieval-Augmented Generation หรือ RAG) หลักสูตรครอบคลุมกระบวนการทั้งหมดตั้งแต่การรับข้อมูล การแบ่งชุดข้อมูล (chunking) กลยุทธ์การจับคู่การแทนความหมาย (embedding mapping) การจัดเก็บเวกเตอร์ การค้นหาแบบไฮบริด การจัดลำดับใหม่ และการประเมินผล เพื่อสร้างแอปพลิเคชันปัญญาประดิษฐ์ที่น่าเชื่อถือ
เชี่ยวชาญศิลปะการสร้างระบบที่อิงจากหลักฐานผ่านแนวทางการประมวลผลแบบครบวงจรของ RAG
ผู้เขียน: EvoClass
คำขอบคุณ: ทีมงาน EvoClass
เป้าหมายการเรียนรู้
- แยกแยะระหว่างการใช้ Prompt, Fine-tuning และ RAG เพื่อเลือกเครื่องมือที่เหมาะสมกับความต้องการทางธุรกิจเฉพาะเจาะจง
- วิเคราะห์การไหลของข้อมูลภายในสายการผลิตของ RAG ตั้งแต่คำถามของผู้ใช้จนถึงการสร้างผลลัพธ์ที่มีพื้นฐานจากข้อมูล
- ออกแบบระบบการนำเข้าข้อมูลอย่างมืออาชีพที่รวมเมตาดาต้า การปรับมาตรฐาน และการติดตามเวอร์ชัน เพื่อป้องกันปัญหา "ข้อมูลอ่อน" หรือข้อมูลที่ไม่แข็งแรง
- ประเมินและนำไปใช้ กลยุทธ์การแบ่งชุดข้อมูลที่หลากหลาย (แบบความยาวคงที่, เข้าใจโครงสร้าง, แบบหลายระดับ) ตามความต้องการเฉพาะด้าน
- อธิบายกลไกการทำงาน ของ embedding และความแตกต่างระหว่างความคล้ายคลึงทางความหมายกับประโยชน์ในการตอบคำถาม
- อธิบายแนวคิดทางเทคนิค ของระบบจัดเก็บเวกเตอร์และการดัชนี โดยเน้นความสมดุลระหว่างความเร็วในการค้นหา (ความหน่วงเวลา) กับความแม่นยำ
- ออกแบบแผนการค้นหาหลายขั้นตอนสำหรับข้อมูลขนาดใหญ่ (มากกว่า 100,000 ชุด) พร้อมกลยุทธ์การกรองเมตาดาต้า
- แยกแยะเป้าหมายของการค้นหา (ความครอบคลุม/ความแม่นยำ) กับการจัดลำดับใหม่ (ความแม่นยำ/ความเกี่ยวข้อง)
- วิเคราะห์เหตุผลว่าทำไมการจัดลำดับใหม่จึงจำเป็นต่อการสร้างข้อความโดยโมเดลภาษาขนาดใหญ่ และวิเคราะห์ปฏิสัมพันธ์กับการออกแบบชุดข้อมูล
- ออกแบบโครงสร้างเมตาดาต้าเบื้องต้นที่สนับสนุนการอ้างอิงอัตโนมัติและการค้นหาที่รู้จักเวอร์ชัน