LLM là gì? LLM (Large Language Model, tức mô hình ngôn ngữ lớn) là mạng nơ-ron được huấn luyện trên lượng văn bản khổng lồ để dự đoán token tiếp theo. Nhờ vậy nó sinh ra văn bản, code và câu trả lời. Cần nhớ ngay: LLM là mô hình, còn ChatGPT hay Claude là sản phẩm xây trên mô hình đó.

LLM – Nền tảng của AI hiện đại
Bài này viết cho sinh viên IT và lập trình viên mới. Bạn sẽ đi từ khái niệm nền tảng đến chỗ tự gọi được một LLM bằng Python, không cần toán cao cấp.
LLM là gì? Định nghĩa dễ hiểu cho người mới
LLM là chương trình học từ dữ liệu văn bản. Nó không tra cứu cơ sở dữ liệu có sẵn, mà học quy luật thống kê của ngôn ngữ rồi sinh nội dung mới. Nói gọn: LLM đoán từ tiếp theo, đoán rất nhiều lần, và đoán rất giỏi.
Tách từng chữ: Large — Language — Model
- Large — lớn về số tham số (hàng tỷ) và dữ liệu huấn luyện (hàng nghìn tỷ token).
- Language — đầu vào, đầu ra đều là văn bản. Code cũng là văn bản, nên LLM xử lý được code.
- Model — một file chứa các con số đã học, kèm phần mềm chạy file đó.
So sánh đời thường: bộ gõ dự đoán từ, phóng to hàng tỷ lần
Bạn gõ “hôm nay trời” trên điện thoại, bàn phím gợi ý “đẹp” hoặc “mưa”. Đó chính là nguyên lý của LLM, chỉ khác quy mô. Bàn phím nhìn lại vài từ, còn LLM nhìn lại hàng trăm nghìn từ, nên nó đoán được cả một hàm Python hoàn chỉnh.
Trả lời LLM là gì theo sơ đồ lồng nhau
Bốn thuật ngữ hay bị nhầm lẫn, thực ra lồng vào nhau như những chiếc hộp:
- AI là hộp lớn nhất, gồm mọi kỹ thuật làm máy tính hành xử thông minh.
- Machine learning nằm trong AI, học từ dữ liệu thay vì lập trình từng luật.
- Deep learning nằm trong machine learning, dùng mạng nơ-ron nhiều lớp.
- LLM nằm trong deep learning, chuyên về ngôn ngữ.
Vậy mọi LLM đều là AI, nhưng không phải AI nào cũng là LLM.
LLM là gì khi so với ChatGPT, Claude và Gemini?
Trả lời ngắn: ChatGPT, Claude và Gemini là ứng dụng, còn LLM là động cơ bên trong. Hãy nghĩ đến ô tô: động cơ là một thứ, chiếc xe hoàn chỉnh là thứ khác. Vì vậy khi gọi API, bạn chọn mô hình, không phải sản phẩm.
| Hãng | Dòng mô hình | Sản phẩm người dùng | Lập trình viên truy cập qua |
|---|---|---|---|
| OpenAI | GPT | ChatGPT | OpenAI API |
| Anthropic | Claude (Opus, Sonnet, Haiku) | Claude, Claude Code | Anthropic API |
| Gemini | Gemini, Gemini CLI | Gemini API | |
| Meta / DeepSeek / Alibaba | Llama, DeepSeek, Qwen | app riêng hoặc không có | API hoặc tải trọng số tự chạy |
Lưu ý: bảng xếp hạng mô hình đổi gần như hằng tháng. Hãy mở tài liệu chính thức trước khi chọn mô hình. Ví dụ, tính đến 22/09/2026, dòng mới nhất trên bảng giá API chính thức của OpenAI là GPT-6 Astra, bên cạnh ba biến thể GPT-5.6.
LLM hoạt động như thế nào? Ba khái niệm phải nắm
Bạn chỉ cần ba khái niệm: token, Transformer và dự đoán token tiếp theo.
Token — LLM không đọc chữ, nó đọc token
Token là đơn vị nhỏ nhất mà mô hình xử lý: một từ, một phần của từ, hoặc một dấu câu. Điều này quan trọng vì bạn trả tiền theo token, và giới hạn ngữ cảnh cũng tính theo token.
Một chi tiết ảnh hưởng trực tiếp đến người Việt: tiếng Việt tốn nhiều token hơn tiếng Anh cho cùng một ý, do tokenizer được tối ưu cho tiếng Anh. Bạn tự kiểm chứng được:
# pip install tiktoken
import tiktoken
enc = tiktoken.get_encoding("cl100k_base")
en = "Large language models predict the next token."
vi = "Mô hình ngôn ngữ lớn dự đoán token tiếp theo."
print("Tiếng Anh:", len(enc.encode(en)), "token")
print("Tiếng Việt:", len(enc.encode(vi)), "token")
Transformer và attention — vì sao mô hình nhớ được ngữ cảnh
Transformer là kiến trúc đứng sau gần như mọi LLM hiện nay, giới thiệu trong bài báo Attention Is All You Need (2017).
Ý tưởng cốt lõi gọi là attention, tức cơ chế chú ý. Khi xử lý một từ, mô hình tự chấm điểm xem từ nào khác trong câu là quan trọng. Ví dụ với câu “Con mèo đuổi con chuột vì nó đói”, attention gán trọng số cao cho “con mèo”.
Một điểm cần đính chính: nhiều tài liệu tiếng Việt cũ mô tả LLM có “lớp recurrent”. Điều đó không đúng. Transformer ra đời chính là để thay thế mạng recurrent.
Dự đoán token tiếp theo — sao chỉ đoán từ mà viết được code?
Mô hình chỉ làm một việc: cho một chuỗi token, nó tính xác suất cho token kế tiếp rồi chọn một token, sau đó lặp lại.
Vậy vì sao kết quả mạch lạc? Để đoán đúng trong hàng nghìn tỷ ví dụ, mô hình buộc phải học nhiều thứ ẩn phía sau: ngữ pháp, cấu trúc code, quy ước đặt tên, cả những mẫu suy luận thường gặp.
Nói cách khác, “đoán từ tiếp theo” chỉ là bài tập huấn luyện. Đó cũng là câu trả lời sâu nhất cho câu hỏi LLM là gì.
LLM được huấn luyện như thế nào?
Quá trình tạo ra một LLM gồm ba giai đoạn:
- Pre-training. Mô hình đọc khối văn bản khổng lồ và chỉ luyện một việc: đoán token tiếp theo. Kết quả là mô hình “biết nhiều” nhưng chưa biết nghe lời.
- Fine-tuning: Đội huấn luyện đưa vào các cặp hướng dẫn và câu trả lời mẫu, dạy mô hình trả lời đúng thứ được hỏi.
- RLHF: Học tăng cường từ phản hồi của con người. Người đánh giá xếp hạng câu trả lời, mô hình học cách tạo câu được xếp hạng cao. Đây là lý do nó biết từ chối yêu cầu nguy hiểm.
Tham số 7B, 70B nghĩa là gì?
Chữ B là billion, tức tỷ tham số. Nhiều tham số hơn thường cho chất lượng tốt hơn, nhưng cần nhiều bộ nhớ và đắt hơn. Ước lượng thô: mô hình 7B nén 4-bit cần khoảng 4–5 GB RAM, nên chạy được trên laptop 16 GB.
Những con số lập trình viên cần hiểu khi dùng LLM
Khi chuyển từ “dùng chatbot” sang “gọi API”, bạn gặp vài con số quyết định chi phí.
Context window
Context window là tổng số token mô hình xử lý trong một lần gọi, gồm cả câu hỏi lẫn câu trả lời. Khoảng 1.000 token tương đương 3–4 trang A4 tiếng Anh.
Con số này tăng rất nhanh: tài liệu OpenAI ngày 22/09/2026 ghi context window 1,05 triệu token cho GPT-6 và GPT-5.6. Khi vượt giới hạn, mô hình phải bỏ bớt phần đầu. Đó là lúc bạn thấy AI “quên” yêu cầu vừa nói.
Temperature, max_tokens và system prompt
- temperature — mức ngẫu nhiên. Thấp thì ổn định, cao thì đa dạng. Sinh code nên để thấp.
- max_tokens — giới hạn độ dài đầu ra. Đặt quá thấp, câu trả lời bị cắt ngang.
- system prompt — lời dặn nền, quy định vai trò và phong cách mô hình.
Chi phí tính theo token
Bạn trả riêng cho token đầu vào và token đầu ra, trong đó token đầu ra đắt hơn nhiều.
Ví dụ kiểm chứng ngày 22/09/2026 trên bảng giá OpenAI: biến thể rẻ nhất GPT-5.6 Luna có giá 0,20 USD mỗi triệu token đầu vào và 1,20 USD mỗi triệu token đầu ra. Mô hình mạnh nhất đắt hơn khoảng 50 lần ở chiều đầu vào.
Mẹo: dùng mô hình rẻ để chạy thử, chỉ đổi sang mô hình mạnh ở bước cuối.
Hướng dẫn gọi API LLM bằng Python trong 10 phút
Cách chắc chắn nhất để hiểu LLM là gì là tự gọi thử một mô hình.
Bước 1: Cài Python, thư viện và API key
Kiểm tra Python bằng python3 --version. Nếu báo lỗi, hãy tải Python từ python.org rồi cài. Tiếp theo, tạo môi trường ảo và cài thư viện:
python3 -m venv venv
source venv/bin/activate # Windows: venv\Scripts\activate
pip install openai tiktoken
Sau đó tạo API key trong trang quản trị của nhà cung cấp. Đừng bao giờ dán key thẳng vào code:
export OPENAI_API_KEY="khoa-cua-ban" # Windows: setx OPENAI_API_KEY "khoa-cua-ban"
Bước 2: Mười lăm dòng code gửi prompt và nhận trả lời
import os
from openai import OpenAI
client = OpenAI(api_key=os.environ["OPENAI_API_KEY"])
response = client.chat.completions.create(
model="gpt-5.6-luna",
messages=[
{"role": "system", "content": "Bạn là trợ giảng lập trình, trả lời ngắn gọn bằng tiếng Việt."},
{"role": "user", "content": "Giải thích vòng lặp for trong Python cho người mới."}
],
temperature=0.3,
max_tokens=300,
)
print(response.choices[0].message.content)
Giải thích từng phần:
model— tên mô hình. Đổi tên ở đây là đổi động cơ, phần code còn lại giữ nguyên.messages— lịch sử hội thoại, mỗi phần tử córolelàsystem,userhoặcassistant.temperature=0.3— giữ câu trả lời ổn định, hợp nội dung kỹ thuật.
Bước 3: Đổi tham số và quan sát khác biệt
Hãy chạy lại cùng prompt với temperature=0.0, rồi temperature=1.2. Ở mức 0.0 bạn nhận gần như cùng một câu trả lời, còn ở mức 1.2 câu chữ thay đổi nhiều hơn.
Sau đó đổi system prompt thành “Bạn là giảng viên khó tính, luôn hỏi lại trước khi trả lời”. Hành vi mô hình đổi hẳn dù câu hỏi không đổi. Kỹ năng viết những câu dặn đó gọi là prompt engineering.
Ba lỗi thường gặp ở lần chạy đầu
- 401 Unauthorized — key sai hoặc chưa nạp. Chạy
echo $OPENAI_API_KEYđể kiểm tra. - 429 Rate limit — hết quota. Chờ một lát hoặc kiểm tra mục billing.
- Model not found — tên mô hình sai hoặc đã bị gỡ. Chép lại đúng tên từ tài liệu.
Bạn muốn học AI coding có lộ trình thay vì mò mẫm từng API? Khóa AI Coding tại CodeGym Đà Nẵng đi từ nền tảng lập trình đến làm sản phẩm thật với LLM. Xem lộ trình AI Coding
LLM mã nguồn mở và LLM tiếng Việt
Không phải lúc nào bạn cũng cần API trả phí. Với dữ liệu nhạy cảm, chạy mô hình ngay trên máy là lựa chọn tốt.
Chạy mô hình mở trên laptop bằng Ollama
Các họ mô hình mở phổ biến gồm Llama, Qwen, DeepSeek và Mistral. Trọng số được công bố, nên bạn tải về chạy offline được. Cách nhanh nhất là dùng Ollama, chỉ cần hai lệnh sau khi cài:
ollama pull qwen3:8b
ollama run qwen3:8b
Lệnh đầu tải mô hình, lệnh sau mở cửa sổ chat trong terminal. Ollama cũng dựng sẵn API cục bộ ở http://localhost:11434, nên bạn gọi nó từ code như gọi dịch vụ đám mây.
LLM tiếng Việt và bảng đánh giá VMLU
Việt Nam đã có một số mô hình riêng cho tiếng Việt, chẳng hạn PhoGPT của VinAI, ViGPT của VinBigData và Vistral. Để so sánh, cộng đồng thường tham chiếu bộ đánh giá VMLU.
Tuy nhiên hãy giữ kỳ vọng thực tế. Mô hình quốc tế cỡ lớn xử lý tiếng Việt khá tốt, nên mô hình Việt thắng ở chỗ khác: chi phí, tự chủ dữ liệu và khả năng tinh chỉnh riêng.
Ghi chú: danh sách này và thứ hạng VMLU thay đổi theo thời gian, hãy kiểm tra lại trước khi trích dẫn.
Nên chọn API trả phí hay mô hình mở?
| Tiêu chí | API trả phí | Mô hình mở tự chạy |
|---|---|---|
| Bắt đầu | vài phút | vài giờ |
| Chi phí | trả theo token | miễn phí, tốn phần cứng |
| Dữ liệu | gửi lên máy chủ hãng | ở lại máy bạn |
Lời khuyên cho đồ án: bắt đầu bằng API để chạy được luồng, rồi thử thay bằng mô hình mở.
Hạn chế của LLM và cách lập trình viên đối phó
Hiểu LLM là gì cũng bao gồm hiểu nó sai ở đâu. Ba hạn chế sau bạn gặp ngay tuần đầu.
Hallucination
Hallucination là hiện tượng mô hình đưa thông tin sai nhưng trình bày rất tự tin. Ví dụ kinh điển: nó gợi ý một hàm trong thư viện, và hàm đó không tồn tại.
Nguyên nhân nằm ở bản chất: mô hình tối ưu cho chuỗi token hợp lý, chứ không phải đúng sự thật. Cách đối phó là đối chiếu tài liệu chính thức, chạy thử và viết test.
Knowledge cutoff
Mỗi mô hình có mốc dữ liệu cuối cùng. Tài liệu OpenAI ghi mốc kiến thức của GPT-6 Astra là 30/04/2026. Sau mốc đó, mô hình không biết gì thêm nếu bạn không cung cấp. Đây là lý do cần tìm kiếm web hoặc RAG để nạp tài liệu mới vào ngữ cảnh.
Bảo mật
Đừng dán khóa API, chuỗi kết nối cơ sở dữ liệu hay mã nguồn nội bộ vào dịch vụ công cộng. Với dữ liệu nhạy cảm, hãy chọn mô hình chạy cục bộ.
LLM liên quan gì đến RAG, AI agent, MCP và AI coding?
Bốn thuật ngữ này luôn xuất hiện cạnh nhau. Bạn chỉ cần nhớ vai trò của từng cái:
- RAG giải bài toán kiến thức: tìm tài liệu liên quan trước, rồi mới đưa cho mô hình trả lời.
- AI agent giải bài toán hành động: mô hình được trao công cụ, tự lặp vòng quan sát và thực thi. Xem AI Agent là gì.
- MCP giải bài toán kết nối: chuẩn mở nối mô hình với công cụ bên ngoài, chi tiết ở bài MCP là gì.
- AI coding là ứng dụng tất cả những thứ trên vào viết phần mềm, xem trang AI coding.
Tóm lại, LLM là lõi, còn ba khái niệm kia là lớp bọc quanh nó.
Sinh viên IT nên học gì về LLM? Lộ trình ba bước
Sau khi nắm được LLM là gì, câu hỏi tiếp theo là học gì. Điều đó phụ thuộc vào đích đến.
- Bước 1 — Dùng thành thạo. Viết prompt rõ ràng và gọi API bằng Python. Không cần toán, và hầu hết sinh viên nên làm thật chắc ở đây.
- Bước 2 — Xây ứng dụng. Làm chatbot hỏi đáp trên tài liệu của bạn, tức hệ RAG nhỏ. Cần Python vững và hiểu embedding.
- Bước 3 — Đi sâu. Học fine-tuning và deep learning, chỉ khi bạn theo hướng AI engineer.
Các nhà tuyển dụng tại Đà Nẵng ít khi yêu cầu sinh viên tự huấn luyện mô hình. Họ quan tâm hơn tới việc nhân sự ghép được LLM vào sản phẩm chạy thật hơn. Xem thêm cụm bài thực tập IT.
Câu hỏi thường gặp về LLM
LLM và ChatGPT có phải là một không?
Không. LLM là mô hình, còn ChatGPT là ứng dụng chat xây trên mô hình đó. Cách nhớ dễ nhất: LLM giống động cơ, ChatGPT giống chiếc xe. Một ứng dụng có thể đổi mô hình bên dưới, và một mô hình phục vụ được nhiều ứng dụng.
LLM có hiểu ngôn ngữ như con người không?
Không theo cách con người hiểu. LLM học quy luật thống kê rất sâu của ngôn ngữ, đủ để tạo câu trả lời mạch lạc. Nhưng nó không có trải nghiệm thực tế và không tự kiểm chứng sự thật, nên bạn luôn cần đối chiếu tài liệu chính thức.
Sinh viên IT có cần học deep learning để dùng LLM không?
Không bắt buộc. Để dùng LLM trong sản phẩm, bạn chỉ cần Python, biết gọi API và viết prompt rõ ràng. Deep learning cần thiết khi bạn muốn fine-tuning. Hãy học theo thứ tự: dùng được trước, xây ứng dụng sau.
Token là gì và vì sao tiếng Việt tốn token hơn tiếng Anh?
Token là đơn vị nhỏ nhất mà mô hình xử lý, có thể là một từ hoặc một phần của từ. Tiếng Việt tốn nhiều token hơn vì tokenizer của đa số mô hình tối ưu cho tiếng Anh. Hệ quả: cùng nội dung, prompt tiếng Việt tốn chi phí cao hơn.
Hallucination là gì và có tránh hoàn toàn được không?
Hallucination là việc mô hình đưa thông tin sai nhưng nghe rất thuyết phục. Bạn không loại bỏ được hoàn toàn, vì đó là hệ quả của cách mô hình sinh văn bản. Nhưng bạn giảm được đáng kể bằng cách nạp tài liệu gốc qua RAG và chạy thử code trước khi tin.
Học về LLM có giúp xin việc dễ hơn không?
Có, nếu bạn thể hiện bằng sản phẩm thay vì từ khóa. Một đồ án dùng LLM chạy thật, có xử lý lỗi và đánh giá chất lượng, gây ấn tượng hơn hẳn dòng “biết dùng ChatGPT” trong CV. Nhà tuyển dụng quan tâm khả năng ghép công nghệ vào sản phẩm.
Kết luận: LLM là gì, tóm lại trong ba ý
Vậy tóm lại, LLM là gì? Đó là mô hình dự đoán token tiếp theo, huấn luyện ở quy mô rất lớn, và là lõi của mọi công cụ AI bạn đang dùng.
Ba điều đáng nhớ: phân biệt mô hình với sản phẩm; token và context window quyết định chi phí lẫn giới hạn; và bạn đã đủ sức tự gọi một LLM mà không cần deep learning.
Bước tiếp theo: mở terminal, chạy lại đoạn code 15 dòng ở trên, rồi đổi temperature và xem điều gì thay đổi.
CTA cuối bài: Bạn muốn đi từ nền tảng lập trình đến làm sản phẩm thật với LLM, có mentor kèm và dự án đưa được vào portfolio? Xem khóa AI Coding tại CodeGym Đà Nẵng, hoặc tìm hiểu lộ trình thực tập IT để chuẩn bị cho kỳ thực tập sắp tới.





0 Lời bình