LLM là gì? Cách 'bộ não' AI dự đoán từ tiếp theo

LLM (Large Language Model) là 'đứa trẻ học nói' bằng cách đọc hàng tỷ trang Internet. Hiểu cách LLM hoạt động giúp bạn dùng AI hiệu quả, biết khi nào AI bịa, và chọn đúng model cho công việc.

12 phút đọcCập nhật 2026-05-19
Đang tải audio...
Mục lục bài viết(27)
Sơ đồ kiến trúc Transformer — encoder + decoder + attention layer

Sơ đồ kiến trúc Transformer (2017, Google) — bên trái là encoder (mã hoá input), bên phải là decoder (giải mã output), kết nối qua attention layer (lớp chú ý). Mọi LLM hiện đại (GPT-5, Claude Opus 4.7, Gemini 2.0) đều dựa trên kiến trúc này. Bài báo "Attention Is All You Need" mở đầu kỷ nguyên AI mà chúng ta đang sống. Nguồn: Wikimedia Commons (CC BY 4.0).

Hiểu đơn giản nhất

LLM (Large Language Model — Mô hình Ngôn ngữ Lớn) là đứa trẻ thiên tài học nói bằng cách đọc hàng tỷ trang văn bản trên Internet. Sau khi học xong, đứa trẻ này có thể:

  • Trả lời câu hỏi bất kỳ
  • Viết code (xem AI Coding là gì)
  • Dịch ngôn ngữ
  • Tóm tắt văn bản
  • Sáng tác thơ, kịch bản
  • Lý luận từng bước

Cốt lõi của LLM: đoán từ tiếp theo trong câu. Bạn đưa "Hôm nay trời rất...", LLM đoán "đẹp" (xác suất 30%), "đẹp" (25%), "nóng" (20%), "lạnh" (15%), v.v. Chọn từ có xác suất cao nhất → lặp lại → tạo ra câu hoàn chỉnh.

Nghe đơn giản, nhưng khi làm điều này với hàng triệu lần lặp + đã đọc cả Wikipedia + GitHub + Stack Overflow + sách + báo, kết quả là một "máy" gần như có thể trả lời mọi câu hỏi.

Tại sao bạn cần biết

  • Dùng AI hiệu quả hơn. Hiểu LLM "đoán" giúp bạn viết prompt (yêu cầu cho AI) tốt hơn — đưa context (bối cảnh) rõ, ép format (định dạng) cụ thể.
  • Biết khi nào AI bịa. LLM tự tin trả lời cả khi không biết → bạn cần verify (kiểm tra) các thông tin quan trọng.
  • Chọn đúng model. Claude Opus đắt 50x Haiku. Hiểu trade-off (đánh đổi) để không lãng phí tiền cho task đơn giản.
  • Tránh hype. Báo chí giật tít "AI sẽ thay thế lập trình viên" — hiểu LLM thực sự làm gì giúp bạn đánh giá đúng.

LLM được "dạy" thế nào — 3 giai đoạn

LLM hiện đại trải qua 3 giai đoạn training (đào tạo):

Giai đoạn 1: Pre-training (đào tạo nền tảng)

LLM đọc hàng tỷ trang văn bản từ Internet, sách, code, Wikipedia. Mục tiêu duy nhất: đoán từ tiếp theo.

DatasetKhối lượngNội dung
Common Crawl~3 tỷ trang webToàn bộ public web
Wikipedia6 triệu bàiToàn bộ ngôn ngữ
GitHub1 tỷ repoCode đủ ngôn ngữ
Books10 triệu sáchSách giáo khoa + tiểu thuyết
Stack Overflow20 triệu Q&ACâu hỏi lập trình

Pre-training mất 3-12 tháng trên cluster GPU $50-500 triệu USD. Kết quả: LLM "biết" pattern ngôn ngữ + facts (sự kiện) đến thời điểm cut-off (mốc dừng training). Vd: Claude Opus 4.7 cut-off tháng 1/2026.

Giai đoạn 2: Instruction tuning (đào tạo theo hướng dẫn)

LLM sau pre-training chỉ biết "đoán từ tiếp theo" — không biết "trả lời câu hỏi". Engineer (kỹ sư) đưa hàng triệu cặp "câu hỏi → câu trả lời mẫu" để LLM học cách làm theo hướng dẫn.

Ví dụ:

  • Hỏi: "Viết function tính tổng 2 số trong Python"
  • Trả lời: def add(a, b): return a + b

Sau giai đoạn này, LLM biết "lắng nghe + làm" thay vì chỉ "đọc + đoán".

Giai đoạn 3: RLHF — Học từ phản hồi con người

RLHF (Reinforcement Learning from Human Feedback — Học tăng cường từ phản hồi con người). Human (con người) review (xem xét) câu trả lời của LLM, cho điểm 1-5 hoặc chọn câu nào tốt hơn → LLM tự tinh chỉnh để trả lời ngày càng "đúng ý" con người.

RLHF tạo ra khác biệt giữa GPT-3 (2020, no RLHF, vô dụng cho chat) và ChatGPT (2022, có RLHF, gây bão Internet).

Token + Tokenization

LLM không đọc "từ" như con người — đọc token (đơn vị ngữ liệu nhỏ, thường là 1 phần của từ).

Token tiếng Anh vs tiếng Việt

Cụm từTiếng Anh tokensTiếng Việt tokens
"Hello world"2 token (Hello, world)
"Xin chào thế giới"~6 token (Xin, chào, thế, giới...)
"Programming"1 token
"Lập trình"~3 token (Lập, trình...)

Tiếng Việt thường tốn 1.5-2x token so với tiếng Anh cùng nội dung. Đây là lý do API call (lệnh gọi API) tiếng Việt đắt hơn tiếng Anh ~50%.

Tại sao token quan trọng

  • Tính tiền theo token: $3-75 cho mỗi 1 triệu token (depending on model — tùy model)
  • Giới hạn context window: Claude Opus 4.7 = 1M token nhưng câu trả lời tối đa ~16k token
  • Tốc độ: LLM sinh ~50-200 token/giây — viết bài 1000 từ mất 5-20 giây

Ước lượng nhanh

  • 1 trang sách (~500 từ tiếng Việt) ≈ 750 token
  • 1 file code 500 dòng ≈ 6.000-10.000 token
  • Toàn bộ wiki Cluster 1 (11 bài, ~18.000 từ) ≈ 27.000 token

Mọi LLM provider hiển thị token usage (sử dụng token) sau mỗi request — kiểm tra dashboard (bảng điều khiển) để biết bạn đang tiêu bao nhiêu.

Context window — "trí nhớ làm việc" của LLM

Context window = số token LLM "nhìn thấy" cùng lúc (cả prompt input + output sinh ra). Vượt → LLM quên phần đầu cuộc nói chuyện.

ModelContextTương đương
GPT-3.5 (2022)4K3 trang sách
Claude 2 (2023)100K75 trang
Claude 3 Opus (2024)200K150 trang
Gemini 1.5 (2024)2M1.500 trang
Claude Opus 4.7 (2026)1M750 trang

Trong coding task (tác vụ lập trình), context cần đủ chứa: code base hiện tại + documentation + lịch sử trò chuyện. 200K thường đủ; 1M dư dả cho 95% dự án.

Hallucination — vấn đề lớn của LLM

Hallucination = LLM tự tin sinh thông tin SAI. Vd:

  • Invent function name không tồn tại trong thư viện
  • Dẫn sách/báo không có thật
  • Tính sai phép toán đơn giản
  • Khẳng định fact (sự thật) sai

Tại sao xảy ra? Vì LLM được train để "đoán có vẻ hợp lý" KHÔNG phải "nói thật". Khi không biết, LLM vẫn đoán theo pattern → đoán SAI.

Tỷ lệ hallucination 2026

ModelTỷ lệ ước tính (general task)
GPT-3.5~15%
GPT-4 (2023)~7%
Claude 3 Opus (2024)~5%
Claude Sonnet 4.6 (2026)~3%
Claude Opus 4.7 (2026)~2%

Còn ~2% là không zero. Cách giảm:

  • RAG (Retrieval Augmented Generation — đưa data thật vào context)
  • Tool use (cho LLM gọi function thật để verify)
  • Lower temperature (đoán deterministic hơn)
  • Specific prompt (nói rõ "nếu không biết thì trả lời 'không biết'")

4 LLM phổ biến 2026 — so sánh

ModelProviderMạnh ởYếu ởGiá (1M token input/output)
Claude Opus 4.7AnthropicLý luận lập trình, agent tool useGiá đắt$15 / $75
Claude Sonnet 4.6AnthropicCân bằng speed/quality cho coding$3 / $15
Claude Haiku 4.5AnthropicRẻ, nhanh, đủ cho task đơn giảnLý luận phức tạp kém$0.80 / $4
GPT-5OpenAIĐa năng, ChatGPT integrationCoding kém hơn Claude$10 / $30
Gemini 2.0 ProGoogleContext 2M, free tier hào phóngQuality hơi kém Claude/GPT$1.25 / $5
Llama 3.3 70BMetaOpen-source, self-host đượcYếu hơn cloud modelsFree (tự host)

VietCodex dùng Claude Sonnet 4.6 cho 80% công việc (cost-effective — hiệu quả về chi phí), Claude Opus 4.7 cho refactor lớn + architecture design (5%), Claude Haiku 4.5 cho lint check + simple Q&A (15%).

Model size — "to" có quan trọng không?

Parameter (tham số) = các "núm vặn" trong mạng neural. Model nhiều parameter → khả năng tiềm năng cao hơn.

ClassSizeVí dụRun được ở đâu
Small1-7BLlama 3 7B, Phi 3Laptop có GPU
Mid8-70BLlama 3 70B, Qwen 72BServer GPU đắt ($20-50k)
Large100-500BClaude Opus, GPT-5Cluster (chục server)
Frontier1T+Đang nghiên cứuCluster siêu lớn

Nhưng size không phải tất cả. Llama 3.3 70B (small-mid) có thể đánh bại GPT-4 (large) trong nhiều benchmark (bài kiểm tra) — nhờ training data tốt hơn + thuật toán mới. Sau 2024, "smarter training" quan trọng hơn "bigger model".

Tinh chỉnh hành vi LLM — Temperature + Top_p

Khi gọi LLM qua API, bạn có 2 control (điều khiển) chính:

Temperature (0 - 2)

Mức độ "sáng tạo" của LLM:

  • 0: Deterministic — cùng prompt LUÔN cho cùng câu trả lời. Dùng cho: coding, factual Q&A
  • 0.3: Hơi sáng tạo, vẫn ổn định. Dùng cho: code refactor, summarization (tóm tắt)
  • 0.7 (mặc định ChatGPT/Claude): Cân bằng. Dùng cho: chat thông thường
  • 1.0+: Rất sáng tạo. Dùng cho: writing thơ, brainstorm idea
  • 2.0: Random gần như vô nghĩa. Hiếm dùng.

Top_p (0 - 1)

Chỉ xét N% từ có xác suất cao nhất, bỏ phần còn lại.

  • 1.0: Xét tất cả từ
  • 0.9 (mặc định): Bỏ 10% từ ít có khả năng nhất
  • 0.5: Chỉ xét 50% từ phổ biến

Coding: nên dùng temperature=0, top_p=1 để output ổn định + đúng cú pháp.

RAG vs Fine-tune — 2 cách "dạy" LLM thêm data

LLM có cut-off date — không biết sự kiện sau ngày đó. Cũng không biết data riêng của công ty bạn. 2 cách giải:

RAG (Retrieval Augmented Generation)

Pattern:

  1. Đẩy data riêng vào vector database (Pinecone, Chroma, Supabase pgvector)
  2. User hỏi → search (tìm) đoạn liên quan trong vector DB
  3. Đưa đoạn đó vào prompt + câu hỏi
  4. LLM trả lời dựa trên đoạn đó

Lợi: Rẻ ($50-500/tháng cho vector DB + LLM API), update data realtime, không cần train.

Phù hợp: Chatbot tài liệu công ty, FAQ động, search wiki nội bộ.

Ví dụ thực tế: Notion AI dùng RAG để trả lời câu hỏi về workspace bạn — nó search workspace + đưa kết quả vào prompt cho LLM.

Fine-tuning (đào tạo lại)

Pattern:

  1. Chuẩn bị dataset 1.000-100.000 cặp Q/A theo style mong muốn
  2. Train LLM existing (mở-source) tiếp 1-7 ngày trên GPU
  3. Deploy LLM custom thay vì LLM gốc

Lợi: Style/giọng văn riêng, hiểu thuật ngữ chuyên ngành sâu, performance tốt hơn cho narrow domain.

Nhược: Tốn $5k-100k, mất 1-4 tuần, phải retrain khi muốn cập nhật.

Phù hợp: Customer support bot riêng cho 1 ngành, legal AI cho luật VN.

Quy tắc 2026: Thử RAG TRƯỚC. Chỉ fine-tune khi RAG không đạt yêu cầu (rất hiếm trường hợp).

Ví dụ thực tế: AI viết bài wiki bạn đang đọc

Khi tôi (founder VietCodex) viết bài wiki này, đây là cách Claude Opus 4.7 hoạt động:

Input (prompt) tôi gửi:

"Viết bài wiki 'LLM là gì?' cho cluster AI Coding của VietCodex. Audience: non-tech VN. Pattern: analogy đời thường + ví dụ thực tế VN + bảng so sánh + FAQ 7-8 câu. Cross-link với các bài đã có (ai-coding-la-gi, prompt-engineering). Style: 'bạn' không 'anh', mỗi đoạn 3 câu, English term có inline Vietnamese note. Length: 1800-2200 từ."

Quá trình LLM xử lý:

  1. Token hoá prompt: ~250 token input
  2. Generate (sinh) từng token một, đoán từ tiếp theo dựa trên:
    • Pattern từ ~3 tỷ trang web đã train
    • Pattern từ bài AI Coding 1 trong context (~5K token)
    • Pattern từ Cluster 1 đã viết trong context (~10K token)
  3. Output: ~3.000 token (~2.000 từ tiếng Việt)
  4. Tổng thời gian: ~60 giây

Cost cụ thể:

  • Input: 250 + 15.000 (context bài đã có) = 15.250 token × $15/1M = $0.23
  • Output: 3.000 token × $75/1M = $0.22
  • Tổng: ~$0.45 cho 1 bài wiki dài

11 bài Cluster 1 = ~$5. So với thuê writer 50-200k VND/bài (5-22M VND tổng): AI rẻ hơn 1.000-4.000 lần.

Tóm tắt 1 dòng

LLM = mô hình AI lớn (Large Language Model) học đoán từ tiếp theo từ tỷ trang Internet. 3 giai đoạn training: pre-train (đọc Internet) + instruction-tune (học làm theo lệnh) + RLHF (học theo phản hồi con người). Cốt lõi cần biết: token (đơn vị từ), context window (trí nhớ), hallucination (bịa). Claude Sonnet/Opus là best 2026 cho coding. RAG trước, fine-tune chỉ khi RAG không đủ.

Đọc tiếp

Câu hỏi thường gặp

LLM khác chatbot truyền thống thế nào?
Chatbot truyền thống (kiểu 2010-2020) chạy theo rule: 'nếu user hỏi A thì trả lời B', dev viết hàng nghìn rule tay. LLM (từ 2020+) học pattern từ hàng tỷ text trên Internet, tự suy luận trả lời cho câu hỏi CHƯA TỪNG GẶP. Khác biệt cốt lõi: chatbot cũ là 'lookup table' (bảng tra cứu), LLM là 'pattern matcher + generator' (máy nhận dạng + sinh nội dung mới).
Tại sao LLM hay 'bịa' (hallucinate)?
Vì LLM được train để 'đoán từ tiếp theo có vẻ hợp lý nhất', KHÔNG được train để 'nói thật'. Khi gặp câu hỏi không biết, LLM vẫn đoán — và đoán có thể sai (vd: invent API function không tồn tại, hoặc dẫn sách giả). Giảm hallucination bằng: (1) cho LLM access tới data thật (RAG, tool use), (2) ép trả lời 'không biết' khi không chắc, (3) dùng model lớn hơn — Claude Opus hallucinate ~2% vs Claude Haiku ~5%.
Model 7B, 70B, 405B — số đó là gì?
B = billion (tỷ) parameters (tham số — các 'núm vặn' trong mạng neural). 7B = 7 tỷ parameter, 405B = 405 tỷ. Càng nhiều parameter → khả năng càng cao + tốn tài nguyên + đắt. Llama 3.3 70B: chạy được trên 2 GPU H100 ($30k phần cứng), Claude Opus ~500B+ chỉ chạy được trên cluster server giá hàng triệu USD. Người dùng cuối không cần biết — chỉ cần biết 'model nào tốt nhất cho task của tôi'.
Temperature, top_p — 2 thông số 'tinh chỉnh' LLM là gì?
Temperature (nhiệt độ, 0-2): điều khiển 'sáng tạo'. 0 = LLM luôn chọn từ tiếp theo có xác suất cao nhất (đoán deterministic, ổn định). 1 = sáng tạo (cùng prompt ra câu trả lời khác nhau). 2 = quá random, thường vô nghĩa. Top_p (0-1): chỉ xét N% từ có xác suất cao nhất. Coding nên dùng temperature 0-0.3 (ổn định, đúng cú pháp). Creative writing: 0.7-1.0. Mặc định ChatGPT/Claude là 0.7.
RAG là gì? Khi nào dùng RAG thay vì train model riêng?
RAG = Retrieval Augmented Generation. Pattern: bạn có data riêng (catalog sản phẩm, document công ty) → đẩy vào vector database → khi user hỏi, retrieve (tìm) đoạn liên quan → đưa vào context của LLM → LLM trả lời dựa trên đó. RAG rẻ hơn fine-tune (đào tạo lại model) 10-100 lần, kết quả cũng tốt cho 90% use case. Chỉ fine-tune khi cần 'style' (giọng văn) hoặc 'reasoning pattern' đặc thù — không phải knowledge.
AI có 'hiểu' thật không hay chỉ 'đoán'?
Câu hỏi triết học chưa có đáp án dứt khoát. Về mặt KỸ THUẬT: LLM đoán xác suất từ tiếp theo dựa trên statistical pattern từ training data. KHÔNG có 'hiểu' theo nghĩa con người. Nhưng kết quả output của LLM thường VƯỢT QUA test của con người trong nhiều domain (luật, y khoa, lập trình) — gọi là 'emergent capability' (khả năng nổi lên không lường trước). Triết gia + nhà khoa học vẫn đang tranh luận.
Tôi muốn dùng AI cho công ty, có nên tự host LLM hay dùng cloud API?
**Cloud API (Claude, GPT, Gemini)**: chất lượng đỉnh, ko quản hạ tầng, $$$. Phù hợp: 80% trường hợp, MVP, startup. **Self-host (Llama, Qwen, DeepSeek)**: control data 100%, không gửi ra ngoài, chi phí cố định/tháng. Phù hợp: data sensitive (y tế, ngân hàng, chính phủ), volume cao (>10M token/ngày), team có DevOps. 2026 pattern phổ biến VN: dùng cloud cho prototype, self-host khi scale + có yêu cầu compliance.
Học LLM cần background gì?
Để DÙNG LLM (qua API hoặc Claude.ai): không cần background ML. Học 1-2 buổi 'prompt engineering' là đủ. Để FINE-TUNE hoặc tự train LLM: cần Python + PyTorch/Transformers + GPU + 6 tháng học. Để chỉ HIỂU cách LLM hoạt động (không build): đọc bài này + xem '3Blue1Brown Neural Networks' YouTube là đủ tạo mental model tốt.