
RAG, MCP, Skills hay Memory: chọn đúng cho từng tác vụ
Bốn cơ chế giúp AI agent biết thêm: RAG cho tri thức tĩnh, MCP cho dữ liệu sống, Skills cho quy trình, Memory cho thứ agent tự học qua từng session.
Agent của bạn trả lời sai câu "tôi còn bao nhiêu ngày phép" — và phản xạ đầu tiên là nhét thêm tài liệu vào context. Sai chỗ rồi: con số đó không nằm trong PDF nào cả. Bốn cơ chế RAG, MCP, Skills và Memory trả lời bốn câu hỏi khác nhau, và chọn nhầm thì thêm bao nhiêu context cũng vô ích.
RAG: thứ đã được ai đó viết ra
RAG kéo đoạn văn liên quan vào trước khi model sinh câu trả lời, thay vì hy vọng dữ kiện nằm sẵn trong tham số. Kỹ thuật này truy về một paper năm 2020 của Facebook AI Research, UCL và NYU, kết hợp model sequence-to-sequence đã pre-train với một dense vector index các tài liệu truy xuất được. Paper đó báo cáo model RAG sinh ngôn ngữ cụ thể hơn, đa dạng hơn và đúng dữ kiện hơn so với baseline thuần tham số.
Vòng chạy có năm bước: người dùng hỏi, hệ thống chuyển câu hỏi thành query và truy xuất đoạn khớp (thường bằng semantic/vector search), đoạn đó trả về, được ghép vào prompt cùng câu hỏi gốc, rồi model sinh câu trả lời có căn cứ — lý tưởng là kèm trích dẫn nguồn.
Dùng khi tri thức tĩnh và đã nằm đâu đó dạng văn bản: policy doc, runbook, sơ đồ dependency, manual sản phẩm.
MCP: thứ đang sống trong một hệ thống
Nếu RAG là biết nhiều hơn, MCP là làm được nhiều hơn. Đây là giao thức client-server chuẩn hóa để agent nối vào database, SaaS, API nội bộ — đọc dữ liệu sống hoặc thực sự hành động, thay vì lục tài liệu tĩnh. Anthropic mở mã nguồn MCP vào tháng 11/2024, mô tả nó là chuẩn kết nối trợ lý AI tới nơi dữ liệu thực sự nằm, gồm kho nội dung, công cụ nghiệp vụ và môi trường phát triển.
Luồng chạy khác hẳn RAG: agent nối tới MCP server và khám phá tool có sẵn, đọc schema từng tool, lên kế hoạch gọi tool nào theo thứ tự nào, thực thi structured call qua MCP runtime, rồi đưa kết quả về lại mạch suy luận.
Dùng khi câu trả lời là một con số sống. Ngày phép còn lại nằm trong hệ thống HR, không nằm trong file nào để mà retrieve.
Skills: biết cách làm một việc cụ thể
Skill là một thư mục chứa file SKILL.md hướng dẫn, kèm script hoặc tài liệu tham chiếu tùy chọn, mô tả cách agent thực hiện một loại tác vụ — triage lỗi production, dựng slide theo style công ty. Anthropic giới thiệu Agent Skills ngày 16/10/2025 và công bố dưới dạng chuẩn mở để chạy đa nền tảng ngày 18/12/2025.
Ý tưởng thiết kế cốt lõi là progressive disclosure: lúc khởi động agent chỉ nạp tên và mô tả của mỗi skill vào system prompt — đủ để biết khi nào skill đó liên quan — và chỉ đọc toàn bộ nội dung khi quyết định dùng. Nhờ vậy một skill tham chiếu được tài liệu lớn tùy ý mà không phình context mặc định.
Giới hạn cần nhớ: skill không cho agent tầm với mới. Nó bảo được "kiểm error rate rồi kiểm deploy gần nhất", nhưng vẫn cần một cơ chế khác — thường là MCP — để thực sự đọc error rate từ dashboard.
Memory: thứ agent tự nhặt được
Memory khác ba cái trên ở chỗ không ai soạn sẵn cho agent; nó tích lũy từ chính các lượt chạy trước. Khung phân loại được trích dẫn nhiều nhất đến từ paper CoALA năm 2024 của nhóm Princeton, chia thành working memory và long-term memory. Dạng áp dụng gồm bốn loại: working memory (context window hiện tại, mất khi hết session), semantic memory (quy ước luôn cần có, nay thường là file markdown cấp project như CLAUDE.md ở gốc repo), procedural memory (chỗ Agent Skills nằm), và episodic memory (bản ghi cô đọng các session trước — loại khó nhất, vì giữ gì và khi nào hết hạn vẫn chưa có lời giải gọn).
Chỗ hay nhầm nhất
Semantic memory và RAG nghe như một, vì đều là dữ kiện đã viết ra. Khác nhau ở cơ chế và phạm vi: RAG là pipeline truy xuất nhắm vào một corpus lớn, thường ở ngoài, lấy theo nhu cầu bằng search; còn semantic memory trong coding agent thường là một file nhỏ cố định, nạp nguyên vào mỗi session chứ không search.
Đừng coi bốn cái này là bốn lựa chọn loại trừ nhau. Chúng ghép được: một MCP server có thể gọi pipeline RAG như một tool của nó; một skill có thể chỉ định dùng tool MCP cụ thể ở một bước; episodic memory ghi lại skill hay MCP call nào đã giải quyết vấn đề lần trước.
Câu hỏi kiến trúc thật không phải "RAG hay MCP". Nó là: tác vụ này cần thứ đã viết ra, thứ đang sống, quy trình, hay thứ đã học được?
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan

Guardrail cho AI agent: 1.350 lượt chạy nói gì về rò rỉ
26 thg 9, 2026
