LLM là gì? Cách 'bộ não' AI dự đoán từ tiếp theo
LLM (Large Language Model) là 'đứa trẻ học nói' bằng cách đọc hàng tỷ trang Internet. Hiểu cách LLM hoạt động giúp bạn dùng AI hiệu quả, biết khi nào AI bịa, và chọn đúng model cho công việc.
Mục lục bài viết(27)

Sơ đồ kiến trúc Transformer (2017, Google) — bên trái là encoder (mã hoá input), bên phải là decoder (giải mã output), kết nối qua attention layer (lớp chú ý). Mọi LLM hiện đại (GPT-5, Claude Opus 4.7, Gemini 2.0) đều dựa trên kiến trúc này. Bài báo "Attention Is All You Need" mở đầu kỷ nguyên AI mà chúng ta đang sống. Nguồn: Wikimedia Commons (CC BY 4.0).
Hiểu đơn giản nhất
LLM (Large Language Model — Mô hình Ngôn ngữ Lớn) là đứa trẻ thiên tài học nói bằng cách đọc hàng tỷ trang văn bản trên Internet. Sau khi học xong, đứa trẻ này có thể:
- Trả lời câu hỏi bất kỳ
- Viết code (xem AI Coding là gì)
- Dịch ngôn ngữ
- Tóm tắt văn bản
- Sáng tác thơ, kịch bản
- Lý luận từng bước
Cốt lõi của LLM: đoán từ tiếp theo trong câu. Bạn đưa "Hôm nay trời rất...", LLM đoán "đẹp" (xác suất 30%), "đẹp" (25%), "nóng" (20%), "lạnh" (15%), v.v. Chọn từ có xác suất cao nhất → lặp lại → tạo ra câu hoàn chỉnh.
Nghe đơn giản, nhưng khi làm điều này với hàng triệu lần lặp + đã đọc cả Wikipedia + GitHub + Stack Overflow + sách + báo, kết quả là một "máy" gần như có thể trả lời mọi câu hỏi.
Tại sao bạn cần biết
- Dùng AI hiệu quả hơn. Hiểu LLM "đoán" giúp bạn viết prompt (yêu cầu cho AI) tốt hơn — đưa context (bối cảnh) rõ, ép format (định dạng) cụ thể.
- Biết khi nào AI bịa. LLM tự tin trả lời cả khi không biết → bạn cần verify (kiểm tra) các thông tin quan trọng.
- Chọn đúng model. Claude Opus đắt 50x Haiku. Hiểu trade-off (đánh đổi) để không lãng phí tiền cho task đơn giản.
- Tránh hype. Báo chí giật tít "AI sẽ thay thế lập trình viên" — hiểu LLM thực sự làm gì giúp bạn đánh giá đúng.
LLM được "dạy" thế nào — 3 giai đoạn
LLM hiện đại trải qua 3 giai đoạn training (đào tạo):
Giai đoạn 1: Pre-training (đào tạo nền tảng)
LLM đọc hàng tỷ trang văn bản từ Internet, sách, code, Wikipedia. Mục tiêu duy nhất: đoán từ tiếp theo.
| Dataset | Khối lượng | Nội dung |
|---|---|---|
| Common Crawl | ~3 tỷ trang web | Toàn bộ public web |
| Wikipedia | 6 triệu bài | Toàn bộ ngôn ngữ |
| GitHub | 1 tỷ repo | Code đủ ngôn ngữ |
| Books | 10 triệu sách | Sách giáo khoa + tiểu thuyết |
| Stack Overflow | 20 triệu Q&A | Câu hỏi lập trình |
Pre-training mất 3-12 tháng trên cluster GPU $50-500 triệu USD. Kết quả: LLM "biết" pattern ngôn ngữ + facts (sự kiện) đến thời điểm cut-off (mốc dừng training). Vd: Claude Opus 4.7 cut-off tháng 1/2026.
Giai đoạn 2: Instruction tuning (đào tạo theo hướng dẫn)
LLM sau pre-training chỉ biết "đoán từ tiếp theo" — không biết "trả lời câu hỏi". Engineer (kỹ sư) đưa hàng triệu cặp "câu hỏi → câu trả lời mẫu" để LLM học cách làm theo hướng dẫn.
Ví dụ:
- Hỏi: "Viết function tính tổng 2 số trong Python"
- Trả lời:
def add(a, b): return a + b
Sau giai đoạn này, LLM biết "lắng nghe + làm" thay vì chỉ "đọc + đoán".
Giai đoạn 3: RLHF — Học từ phản hồi con người
RLHF (Reinforcement Learning from Human Feedback — Học tăng cường từ phản hồi con người). Human (con người) review (xem xét) câu trả lời của LLM, cho điểm 1-5 hoặc chọn câu nào tốt hơn → LLM tự tinh chỉnh để trả lời ngày càng "đúng ý" con người.
RLHF tạo ra khác biệt giữa GPT-3 (2020, no RLHF, vô dụng cho chat) và ChatGPT (2022, có RLHF, gây bão Internet).
Token + Tokenization
LLM không đọc "từ" như con người — đọc token (đơn vị ngữ liệu nhỏ, thường là 1 phần của từ).
Token tiếng Anh vs tiếng Việt
| Cụm từ | Tiếng Anh tokens | Tiếng Việt tokens |
|---|---|---|
| "Hello world" | 2 token (Hello, world) | — |
| "Xin chào thế giới" | — | ~6 token (Xin, chào, thế, giới...) |
| "Programming" | 1 token | — |
| "Lập trình" | — | ~3 token (Lập, trình...) |
Tiếng Việt thường tốn 1.5-2x token so với tiếng Anh cùng nội dung. Đây là lý do API call (lệnh gọi API) tiếng Việt đắt hơn tiếng Anh ~50%.
Tại sao token quan trọng
- Tính tiền theo token: $3-75 cho mỗi 1 triệu token (depending on model — tùy model)
- Giới hạn context window: Claude Opus 4.7 = 1M token nhưng câu trả lời tối đa ~16k token
- Tốc độ: LLM sinh ~50-200 token/giây — viết bài 1000 từ mất 5-20 giây
Ước lượng nhanh
- 1 trang sách (~500 từ tiếng Việt) ≈ 750 token
- 1 file code 500 dòng ≈ 6.000-10.000 token
- Toàn bộ wiki Cluster 1 (11 bài, ~18.000 từ) ≈ 27.000 token
Mọi LLM provider hiển thị token usage (sử dụng token) sau mỗi request — kiểm tra dashboard (bảng điều khiển) để biết bạn đang tiêu bao nhiêu.
Context window — "trí nhớ làm việc" của LLM
Context window = số token LLM "nhìn thấy" cùng lúc (cả prompt input + output sinh ra). Vượt → LLM quên phần đầu cuộc nói chuyện.
| Model | Context | Tương đương |
|---|---|---|
| GPT-3.5 (2022) | 4K | 3 trang sách |
| Claude 2 (2023) | 100K | 75 trang |
| Claude 3 Opus (2024) | 200K | 150 trang |
| Gemini 1.5 (2024) | 2M | 1.500 trang |
| Claude Opus 4.7 (2026) | 1M | 750 trang |
Trong coding task (tác vụ lập trình), context cần đủ chứa: code base hiện tại + documentation + lịch sử trò chuyện. 200K thường đủ; 1M dư dả cho 95% dự án.
Hallucination — vấn đề lớn của LLM
Hallucination = LLM tự tin sinh thông tin SAI. Vd:
- Invent function name không tồn tại trong thư viện
- Dẫn sách/báo không có thật
- Tính sai phép toán đơn giản
- Khẳng định fact (sự thật) sai
Tại sao xảy ra? Vì LLM được train để "đoán có vẻ hợp lý" KHÔNG phải "nói thật". Khi không biết, LLM vẫn đoán theo pattern → đoán SAI.
Tỷ lệ hallucination 2026
| Model | Tỷ lệ ước tính (general task) |
|---|---|
| GPT-3.5 | ~15% |
| GPT-4 (2023) | ~7% |
| Claude 3 Opus (2024) | ~5% |
| Claude Sonnet 4.6 (2026) | ~3% |
| Claude Opus 4.7 (2026) | ~2% |
Còn ~2% là không zero. Cách giảm:
- RAG (Retrieval Augmented Generation — đưa data thật vào context)
- Tool use (cho LLM gọi function thật để verify)
- Lower temperature (đoán deterministic hơn)
- Specific prompt (nói rõ "nếu không biết thì trả lời 'không biết'")
4 LLM phổ biến 2026 — so sánh
| Model | Provider | Mạnh ở | Yếu ở | Giá (1M token input/output) |
|---|---|---|---|---|
| Claude Opus 4.7 | Anthropic | Lý luận lập trình, agent tool use | Giá đắt | $15 / $75 |
| Claude Sonnet 4.6 | Anthropic | Cân bằng speed/quality cho coding | — | $3 / $15 |
| Claude Haiku 4.5 | Anthropic | Rẻ, nhanh, đủ cho task đơn giản | Lý luận phức tạp kém | $0.80 / $4 |
| GPT-5 | OpenAI | Đa năng, ChatGPT integration | Coding kém hơn Claude | $10 / $30 |
| Gemini 2.0 Pro | Context 2M, free tier hào phóng | Quality hơi kém Claude/GPT | $1.25 / $5 | |
| Llama 3.3 70B | Meta | Open-source, self-host được | Yếu hơn cloud models | Free (tự host) |
VietCodex dùng Claude Sonnet 4.6 cho 80% công việc (cost-effective — hiệu quả về chi phí), Claude Opus 4.7 cho refactor lớn + architecture design (5%), Claude Haiku 4.5 cho lint check + simple Q&A (15%).
Model size — "to" có quan trọng không?
Parameter (tham số) = các "núm vặn" trong mạng neural. Model nhiều parameter → khả năng tiềm năng cao hơn.
| Class | Size | Ví dụ | Run được ở đâu |
|---|---|---|---|
| Small | 1-7B | Llama 3 7B, Phi 3 | Laptop có GPU |
| Mid | 8-70B | Llama 3 70B, Qwen 72B | Server GPU đắt ($20-50k) |
| Large | 100-500B | Claude Opus, GPT-5 | Cluster (chục server) |
| Frontier | 1T+ | Đang nghiên cứu | Cluster siêu lớn |
Nhưng size không phải tất cả. Llama 3.3 70B (small-mid) có thể đánh bại GPT-4 (large) trong nhiều benchmark (bài kiểm tra) — nhờ training data tốt hơn + thuật toán mới. Sau 2024, "smarter training" quan trọng hơn "bigger model".
Tinh chỉnh hành vi LLM — Temperature + Top_p
Khi gọi LLM qua API, bạn có 2 control (điều khiển) chính:
Temperature (0 - 2)
Mức độ "sáng tạo" của LLM:
- 0: Deterministic — cùng prompt LUÔN cho cùng câu trả lời. Dùng cho: coding, factual Q&A
- 0.3: Hơi sáng tạo, vẫn ổn định. Dùng cho: code refactor, summarization (tóm tắt)
- 0.7 (mặc định ChatGPT/Claude): Cân bằng. Dùng cho: chat thông thường
- 1.0+: Rất sáng tạo. Dùng cho: writing thơ, brainstorm idea
- 2.0: Random gần như vô nghĩa. Hiếm dùng.
Top_p (0 - 1)
Chỉ xét N% từ có xác suất cao nhất, bỏ phần còn lại.
- 1.0: Xét tất cả từ
- 0.9 (mặc định): Bỏ 10% từ ít có khả năng nhất
- 0.5: Chỉ xét 50% từ phổ biến
Coding: nên dùng temperature=0, top_p=1 để output ổn định + đúng cú pháp.
RAG vs Fine-tune — 2 cách "dạy" LLM thêm data
LLM có cut-off date — không biết sự kiện sau ngày đó. Cũng không biết data riêng của công ty bạn. 2 cách giải:
RAG (Retrieval Augmented Generation)
Pattern:
- Đẩy data riêng vào vector database (Pinecone, Chroma, Supabase pgvector)
- User hỏi → search (tìm) đoạn liên quan trong vector DB
- Đưa đoạn đó vào prompt + câu hỏi
- LLM trả lời dựa trên đoạn đó
Lợi: Rẻ ($50-500/tháng cho vector DB + LLM API), update data realtime, không cần train.
Phù hợp: Chatbot tài liệu công ty, FAQ động, search wiki nội bộ.
Ví dụ thực tế: Notion AI dùng RAG để trả lời câu hỏi về workspace bạn — nó search workspace + đưa kết quả vào prompt cho LLM.
Fine-tuning (đào tạo lại)
Pattern:
- Chuẩn bị dataset 1.000-100.000 cặp Q/A theo style mong muốn
- Train LLM existing (mở-source) tiếp 1-7 ngày trên GPU
- Deploy LLM custom thay vì LLM gốc
Lợi: Style/giọng văn riêng, hiểu thuật ngữ chuyên ngành sâu, performance tốt hơn cho narrow domain.
Nhược: Tốn $5k-100k, mất 1-4 tuần, phải retrain khi muốn cập nhật.
Phù hợp: Customer support bot riêng cho 1 ngành, legal AI cho luật VN.
Quy tắc 2026: Thử RAG TRƯỚC. Chỉ fine-tune khi RAG không đạt yêu cầu (rất hiếm trường hợp).
Ví dụ thực tế: AI viết bài wiki bạn đang đọc
Khi tôi (founder VietCodex) viết bài wiki này, đây là cách Claude Opus 4.7 hoạt động:
Input (prompt) tôi gửi:
"Viết bài wiki 'LLM là gì?' cho cluster AI Coding của VietCodex. Audience: non-tech VN. Pattern: analogy đời thường + ví dụ thực tế VN + bảng so sánh + FAQ 7-8 câu. Cross-link với các bài đã có (ai-coding-la-gi, prompt-engineering). Style: 'bạn' không 'anh', mỗi đoạn 3 câu, English term có inline Vietnamese note. Length: 1800-2200 từ."
Quá trình LLM xử lý:
- Token hoá prompt: ~250 token input
- Generate (sinh) từng token một, đoán từ tiếp theo dựa trên:
- Pattern từ ~3 tỷ trang web đã train
- Pattern từ bài AI Coding 1 trong context (~5K token)
- Pattern từ Cluster 1 đã viết trong context (~10K token)
- Output: ~3.000 token (~2.000 từ tiếng Việt)
- Tổng thời gian: ~60 giây
Cost cụ thể:
- Input: 250 + 15.000 (context bài đã có) = 15.250 token × $15/1M = $0.23
- Output: 3.000 token × $75/1M = $0.22
- Tổng: ~$0.45 cho 1 bài wiki dài
11 bài Cluster 1 = ~$5. So với thuê writer 50-200k VND/bài (5-22M VND tổng): AI rẻ hơn 1.000-4.000 lần.
Tóm tắt 1 dòng
LLM = mô hình AI lớn (Large Language Model) học đoán từ tiếp theo từ tỷ trang Internet. 3 giai đoạn training: pre-train (đọc Internet) + instruction-tune (học làm theo lệnh) + RLHF (học theo phản hồi con người). Cốt lõi cần biết: token (đơn vị từ), context window (trí nhớ), hallucination (bịa). Claude Sonnet/Opus là best 2026 cho coding. RAG trước, fine-tune chỉ khi RAG không đủ.
Đọc tiếp
- AI Coding là gì? Cách AI giúp bạn viết phần mềm — bài đầu tiên cluster, anchor terminology
- Prompt engineering — cách "nói chuyện" với AI để code đúng — kỹ thuật giao tiếp với LLM (sắp có)
- Claude Code, Cursor, GitHub Copilot — khác nhau ra sao — 3 tool dùng LLM khác nhau (sắp có)
- Database là gì? — vector database là biến thể đặc biệt dùng cho RAG