Dùng eGPU để chạy AI trên máy (local AI) là hướng khá hợp lý. Với mô hình ngôn ngữ (LLM) và AI tạo ảnh, dung lượng VRAM của card quan trọng hơn nhiều so với băng thông cáp eGPU. Khi mô hình nằm gọn trong VRAM, card gắn qua OCuLink chạy gần bằng card cắm thẳng trong máy bàn — phần chậm hơn chủ yếu là lúc tải mô hình. Một card 16GB như RTX 5060 Ti hiện đã chạy được mô hình 27 tỷ tham số được nén tốt, ở tốc độ khoảng 45 token/giây.
Bài này giải thích vì sao AI "dễ tính" với kết nối hơn chơi game, khi nào eGPU vẫn gây chậm, cần bao nhiêu VRAM, và một thử nghiệm thực tế so sánh RTX 5060 Ti với RTX 5090.
eGPU chạy được những loại AI nào?
- Chatbot và trợ lý lập trình chạy trên máy qua Ollama, LM Studio hoặc llama.cpp — dữ liệu không rời khỏi máy, không tốn phí theo lượt dùng.
- AI agent tự điều khiển trình duyệt, đọc trang web, viết file báo cáo.
- Tạo ảnh bằng Stable Diffusion, Flux qua ComfyUI hoặc các giao diện tương tự.
- Chuyển giọng nói thành chữ bằng Whisper.
- Tinh chỉnh (fine-tune) mô hình nhỏ bằng các phương pháp nhẹ như LoRA.
Với laptop mỏng nhẹ hoặc mini PC, eGPU là cách thêm một card NVIDIA hoặc AMD có VRAM riêng mà không phải đổi sang máy bàn.
Vì sao AI ít phụ thuộc băng thông eGPU hơn chơi game?
Khi chơi game, CPU phải liên tục gửi lệnh vẽ và dữ liệu sang card đồ hoạ từng khung hình, nên cáp eGPU (chỉ 4 làn PCIe) thành nút thắt. Với mô hình ngôn ngữ, cách làm việc khác hẳn:
- Tải mô hình một lần: toàn bộ trọng số mô hình được chép vào VRAM khi khởi động. Đây là lúc cáp eGPU bị dùng nhiều nhất.
- Sinh chữ ngay trong card: sau đó, mỗi token (một mẩu chữ) được tính hoàn toàn bên trong card. Dữ liệu đi qua cáp cho mỗi token chỉ vài trăm KB.
Vì vậy tốc độ sinh chữ bị giới hạn bởi băng thông bộ nhớ VRAM của card, không phải băng thông cáp. VRAM nhanh hơn cáp eGPU hàng trăm lần:
| Đường truyền | Băng thông |
|---|---|
| VRAM RTX 5090 | 1.792 GB/s |
| VRAM RTX 5080 | 960 GB/s |
| VRAM RTX 5070 Ti | 896 GB/s |
| VRAM RTX 5070 | 672 GB/s |
| VRAM RTX 5060 Ti | 448 GB/s |
| Cáp OCuLink (PCIe 4.0 x4, đo thực tế) | khoảng 6,6 GB/s |
| Cáp Thunderbolt 5 (phần PCIe, đo thực tế) | khoảng 5,7 GB/s |
Một cách ước lượng nhanh: tốc độ sinh chữ tối đa ≈ băng thông VRAM ÷ dung lượng mô hình. Mô hình 12GB trên card 448 GB/s có trần khoảng 37 token/giây nếu không có kỹ thuật tăng tốc; card 1.792 GB/s có trần gấp 4 lần. Con số này gần như không đổi dù card cắm trong máy bàn hay gắn qua eGPU.
Thử nghiệm của kênh YouTube Alex Ziskind cũng cho kết quả tương tự: cùng một card RTX 50 series 16GB, gắn qua OCuLink và cắm khe PCIe 5.0 x8 cho tốc độ sinh chữ gần như ngang nhau với mô hình dạng dense (dày đặc), chênh lệch nằm trong sai số đo. Khác biệt rõ hơn ở mô hình dạng MoE (nhiều "chuyên gia").
Khi nào kết nối eGPU vẫn làm chậm AI?
- Lúc tải mô hình. Mô hình 12GB qua OCuLink mất khoảng 2 giây nếu ổ SSD đủ nhanh, qua Thunderbolt 4 khoảng 4–5 giây. Nếu chuyển qua lại nhiều mô hình liên tục, khoản này cộng dồn.
- Mô hình lớn hơn VRAM. Khi một phần mô hình phải để ở RAM hệ thống (thường gặp với mô hình MoE cỡ lớn), dữ liệu đi qua cáp nhiều hơn và bước đọc câu lệnh (prompt processing) chậm rõ rệt.
- Ghép nhiều card. Chia một mô hình cho hai eGPU cần các card trao đổi dữ liệu qua cáp liên tục, nên kết nối chậm ảnh hưởng nhiều hơn.
- Tuỳ phần mềm. Một thử nghiệm năm 2024 của Jan với TensorRT-LLM trên RTX 4090 qua Thunderbolt 3 đo được 104,95 token/giây, thấp hơn 38,5% so với cùng card cắm PCIe 4.0 x16 (170,63 token/giây). Nhóm thử nghiệm cũng chưa xác định rõ nguyên nhân. Nghĩa là con số thực tế phụ thuộc cả phần mềm lẫn chuẩn kết nối, không chỉ lý thuyết.
Tóm lại: nếu định chạy AI nghiêm túc, OCuLink hoặc Thunderbolt 5 vẫn là lựa chọn an toàn hơn Thunderbolt 3/4, nhất là khi muốn dùng mô hình lớn hoặc ghép nhiều card.
Phân tích chi tiết từng giai đoạn — tải mô hình, đọc câu lệnh, sinh chữ — và bảng thời gian tải theo từng chuẩn kết nối có ở bài Băng thông eGPU ảnh hưởng chạy AI thế nào.
Cần bao nhiêu VRAM để chạy AI trên máy?
VRAM quyết định mô hình lớn cỡ nào chạy được. Mô hình thường được nén (lượng tử hoá, quantization) để giảm dung lượng; mức nén phổ biến 4-bit cần khoảng 0,6GB VRAM cho mỗi tỷ tham số, cộng thêm phần bộ nhớ cho ngữ cảnh (độ dài cuộc hội thoại).
| VRAM | Chạy được (ước tính, nén 4-bit) | Phù hợp |
|---|---|---|
| 8GB | Mô hình 7–8 tỷ tham số | Tác vụ chuyên biệt, chat cơ bản |
| 12GB | Mô hình 12–14 tỷ tham số | Chat, tóm tắt, tạo ảnh cơ bản |
| 16GB | Mô hình 14 tỷ thoải mái; mô hình 27 tỷ nếu dùng kỹ thuật nén mới | Trợ lý lập trình, agent, tạo ảnh |
| 24GB | Mô hình 27–32 tỷ tham số | Công việc nặng, ngữ cảnh dài |
| 32GB trở lên | Mô hình 32 tỷ với ngữ cảnh rất dài, hoặc chạy song song nhiều phiên | Nhiều agent cùng lúc |
Trước đây, quy tắc chung là muốn chạy AI "làm việc thật" cần card 24GB trở lên. Các kỹ thuật nén mới đang kéo ngưỡng này xuống 16GB, như thử nghiệm dưới đây cho thấy.
Cách tự tính VRAM chi tiết cho từng mô hình, kèm dung lượng thật của các bản nén phổ biến, xem bài Cần bao nhiêu VRAM để chạy AI trên máy.
Thử nghiệm thực tế: RTX 5060 Ti 16GB so với RTX 5090 32GB
Trong video "16GB Is All You Need for Serious AI" (tháng 9/2026), Manolo Remiddi so sánh hai máy chạy cùng một mô hình Qwen 27 tỷ tham số, dùng llama.cpp:
- Mô hình: bản nén không đồng đều GSQ + RCO của nhóm ISTA-DASLab. Mỗi phần của mô hình được nén ở mức khác nhau — nén mạnh chỗ ít quan trọng, giữ chất lượng chỗ quan trọng — trung bình khoảng 3,44 bit mỗi trọng số. File chỉ còn khoảng 11,8GB, trong khi chất lượng được mô tả là gần bằng bản chưa nén.
- Tăng tốc bằng MTP (multi-token prediction — dự đoán nhiều token một lượt), tốn thêm khoảng 0,35GB VRAM.
| RTX 5060 Ti 16GB | RTX 5090 32GB | |
|---|---|---|
| Băng thông VRAM | 448 GB/s | 1.792 GB/s |
| Tốc độ sinh chữ | khoảng 42,5–45,6 token/giây | khoảng 136 token/giây |
| Độ dài ngữ cảnh | 64.000 token | 262.000 token, 2 phiên chạy song song |
| VRAM sử dụng | khoảng 15,1 / 15,9GB | — |
| Giá tham khảo cả máy | khoảng 1.500 USD | khoảng 7.000 USD |
Với tác vụ AI agent — tự mở ba trang web, lấy dữ liệu và viết file báo cáo HTML — RTX 5060 Ti hoàn thành được việc, dù chậm hơn. Theo tác giả, với việc nhỏ gần như không có khác biệt về kết quả; lợi thế của RTX 5090 là ngữ cảnh dài hơn, nên làm việc dài hơn mà không phải tóm tắt lại hội thoại. Điểm trừ của card rẻ là quạt kêu to và rít hơn khi chạy tải nặng.
Tác giả cũng nhắc một so sánh đáng chú ý: băng thông VRAM của RTX 5060 Ti cao hơn khoảng 50–60% so với máy AI chuyên dụng NVIDIA DGX Spark (dùng bộ nhớ hợp nhất dung lượng lớn nhưng chậm hơn). Với mô hình vừa trong 16GB, card nhỏ có VRAM nhanh sinh chữ nhanh hơn.
Lưu ý: thử nghiệm này chạy trên máy bàn, không phải eGPU. Nhưng theo phân tích ở phần trên, khi mô hình 11,8GB đã nằm trong VRAM, tốc độ sinh chữ qua eGPU OCuLink sẽ không khác nhiều.
Vì sao RTX 5060 Ti 16GB hợp làm eGPU cho AI?
- Theo tác giả video, đây là card NVIDIA rẻ nhất có 16GB VRAM, lại dùng được CUDA — nền tảng được phần mềm AI hỗ trợ rộng nhất.
- Tiêu thụ chỉ khoảng 180W, nguồn 450–550W là đủ, vừa với hầu hết hộp eGPU (xem cách chọn nguồn cho eGPU).
- Card chỉ dùng 8 làn PCIe. Khi gắn eGPU còn 4 làn, game bị ảnh hưởng rõ (xem bài làn PCIe và eGPU), nhưng với AI chạy trong VRAM thì thiệt hại ít hơn nhiều.
NVIDIA, AMD hay Intel cho AI qua eGPU?
- NVIDIA: dùng CUDA, gần như mọi phần mềm AI chạy được ngay. Lựa chọn ít rắc rối nhất.
- AMD: dùng ROCm hoặc Vulkan. llama.cpp, Ollama, LM Studio đã hỗ trợ tốt; một số công cụ tạo ảnh và huấn luyện vẫn cần cài đặt thêm. Card AMD thường nhiều VRAM hơn ở cùng mức giá.
- Intel Arc: giá rẻ, VRAM khá, chạy được qua Vulkan hoặc SYCL, nhưng hệ sinh thái phần mềm hẹp nhất.
Nếu dùng máy Mac chip Apple, eGPU không được macOS hỗ trợ cho đồ hoạ — xem bài Razer Core X và Mac.
Câu hỏi thường gặp
eGPU có chạy được ChatGPT trên máy không?
ChatGPT chỉ chạy trên máy chủ của OpenAI. Nhưng eGPU chạy được các mô hình mở tương tự như Qwen, Gemma, Llama, DeepSeek qua Ollama hoặc LM Studio, hoàn toàn trên máy của bạn.
Chạy AI qua eGPU chậm hơn máy bàn bao nhiêu?
Khi mô hình nằm gọn trong VRAM và dùng llama.cpp, tốc độ sinh chữ qua OCuLink gần như ngang máy bàn. Chậm hơn rõ khi tải mô hình, khi mô hình vượt VRAM, hoặc khi ghép nhiều card. Kết nối Thunderbolt 3/4 và một số phần mềm có thể chậm hơn đáng kể.
Card 8GB có chạy AI được không?
Được, với mô hình 7–8 tỷ tham số cho tác vụ đơn giản hoặc chuyên biệt. Muốn dùng trợ lý lập trình hoặc agent, nên có từ 16GB.
Nên dùng OCuLink hay Thunderbolt cho AI?
OCuLink nhanh nhất khi tải mô hình và khi ghép nhiều card. Nếu chỉ chạy một mô hình vừa VRAM, Thunderbolt 5 hay USB4 cũng dùng tốt.
VRAM hay sức mạnh card quan trọng hơn cho AI?
VRAM quyết định chạy được mô hình nào; băng thông VRAM quyết định chạy nhanh cỡ nào. Card nhiều VRAM nhưng yếu vẫn hơn card mạnh mà không đủ VRAM.
Đọc thêm
- Cần bao nhiêu VRAM để chạy AI trên máy? Bảng tra theo mô hình
- Băng thông eGPU ảnh hưởng chạy AI thế nào?
- OCuLink vs Thunderbolt 5 vs USB4: chuẩn nào cho eGPU?
- Làn PCIe và eGPU: x4, 8i, 16i khác nhau thế nào?
- eGPU mất bao nhiêu hiệu năng so với máy bàn?
- Hướng dẫn chọn nguồn cho eGPU
Nguồn tham khảo
- Video "16GB Is All You Need for Serious AI" của Manolo Remiddi: YouTube và bài viết chi tiết
- Thử nghiệm TensorRT-LLM trên eGPU Thunderbolt 3: Jan
- Tóm tắt thử nghiệm OCuLink và PCIe với LLM của Alex Ziskind: Lilys
