Dùng eGPU chạy AI trên máy: có đáng không?

Bảo
0

Dùng eGPU để chạy AI trên máy (local AI) là hướng khá hợp lý. Với mô hình ngôn ngữ (LLM) và AI tạo ảnh, dung lượng VRAM của card quan trọng hơn nhiều so với băng thông cáp eGPU. Khi mô hình nằm gọn trong VRAM, card gắn qua OCuLink chạy gần bằng card cắm thẳng trong máy bàn — phần chậm hơn chủ yếu là lúc tải mô hình. Một card 16GB như RTX 5060 Ti hiện đã chạy được mô hình 27 tỷ tham số được nén tốt, ở tốc độ khoảng 45 token/giây.

Bài này giải thích vì sao AI "dễ tính" với kết nối hơn chơi game, khi nào eGPU vẫn gây chậm, cần bao nhiêu VRAM, và một thử nghiệm thực tế so sánh RTX 5060 Ti với RTX 5090.

Bảng VRAM cần để chạy các mô hình AI trên eGPU

eGPU chạy được những loại AI nào?

  • Chatbot và trợ lý lập trình chạy trên máy qua Ollama, LM Studio hoặc llama.cpp — dữ liệu không rời khỏi máy, không tốn phí theo lượt dùng.
  • AI agent tự điều khiển trình duyệt, đọc trang web, viết file báo cáo.
  • Tạo ảnh bằng Stable Diffusion, Flux qua ComfyUI hoặc các giao diện tương tự.
  • Chuyển giọng nói thành chữ bằng Whisper.
  • Tinh chỉnh (fine-tune) mô hình nhỏ bằng các phương pháp nhẹ như LoRA.

Với laptop mỏng nhẹ hoặc mini PC, eGPU là cách thêm một card NVIDIA hoặc AMD có VRAM riêng mà không phải đổi sang máy bàn.

Vì sao AI ít phụ thuộc băng thông eGPU hơn chơi game?

Khi chơi game, CPU phải liên tục gửi lệnh vẽ và dữ liệu sang card đồ hoạ từng khung hình, nên cáp eGPU (chỉ 4 làn PCIe) thành nút thắt. Với mô hình ngôn ngữ, cách làm việc khác hẳn:

  1. Tải mô hình một lần: toàn bộ trọng số mô hình được chép vào VRAM khi khởi động. Đây là lúc cáp eGPU bị dùng nhiều nhất.
  2. Sinh chữ ngay trong card: sau đó, mỗi token (một mẩu chữ) được tính hoàn toàn bên trong card. Dữ liệu đi qua cáp cho mỗi token chỉ vài trăm KB.

Vì vậy tốc độ sinh chữ bị giới hạn bởi băng thông bộ nhớ VRAM của card, không phải băng thông cáp. VRAM nhanh hơn cáp eGPU hàng trăm lần:

Đường truyềnBăng thông
VRAM RTX 50901.792 GB/s
VRAM RTX 5080960 GB/s
VRAM RTX 5070 Ti896 GB/s
VRAM RTX 5070672 GB/s
VRAM RTX 5060 Ti448 GB/s
Cáp OCuLink (PCIe 4.0 x4, đo thực tế)khoảng 6,6 GB/s
Cáp Thunderbolt 5 (phần PCIe, đo thực tế)khoảng 5,7 GB/s

Một cách ước lượng nhanh: tốc độ sinh chữ tối đa ≈ băng thông VRAM ÷ dung lượng mô hình. Mô hình 12GB trên card 448 GB/s có trần khoảng 37 token/giây nếu không có kỹ thuật tăng tốc; card 1.792 GB/s có trần gấp 4 lần. Con số này gần như không đổi dù card cắm trong máy bàn hay gắn qua eGPU.

Thử nghiệm của kênh YouTube Alex Ziskind cũng cho kết quả tương tự: cùng một card RTX 50 series 16GB, gắn qua OCuLink và cắm khe PCIe 5.0 x8 cho tốc độ sinh chữ gần như ngang nhau với mô hình dạng dense (dày đặc), chênh lệch nằm trong sai số đo. Khác biệt rõ hơn ở mô hình dạng MoE (nhiều "chuyên gia").

Khi nào kết nối eGPU vẫn làm chậm AI?

  • Lúc tải mô hình. Mô hình 12GB qua OCuLink mất khoảng 2 giây nếu ổ SSD đủ nhanh, qua Thunderbolt 4 khoảng 4–5 giây. Nếu chuyển qua lại nhiều mô hình liên tục, khoản này cộng dồn.
  • Mô hình lớn hơn VRAM. Khi một phần mô hình phải để ở RAM hệ thống (thường gặp với mô hình MoE cỡ lớn), dữ liệu đi qua cáp nhiều hơn và bước đọc câu lệnh (prompt processing) chậm rõ rệt.
  • Ghép nhiều card. Chia một mô hình cho hai eGPU cần các card trao đổi dữ liệu qua cáp liên tục, nên kết nối chậm ảnh hưởng nhiều hơn.
  • Tuỳ phần mềm. Một thử nghiệm năm 2024 của Jan với TensorRT-LLM trên RTX 4090 qua Thunderbolt 3 đo được 104,95 token/giây, thấp hơn 38,5% so với cùng card cắm PCIe 4.0 x16 (170,63 token/giây). Nhóm thử nghiệm cũng chưa xác định rõ nguyên nhân. Nghĩa là con số thực tế phụ thuộc cả phần mềm lẫn chuẩn kết nối, không chỉ lý thuyết.

Tóm lại: nếu định chạy AI nghiêm túc, OCuLink hoặc Thunderbolt 5 vẫn là lựa chọn an toàn hơn Thunderbolt 3/4, nhất là khi muốn dùng mô hình lớn hoặc ghép nhiều card.

Phân tích chi tiết từng giai đoạn — tải mô hình, đọc câu lệnh, sinh chữ — và bảng thời gian tải theo từng chuẩn kết nối có ở bài Băng thông eGPU ảnh hưởng chạy AI thế nào.

Cần bao nhiêu VRAM để chạy AI trên máy?

VRAM quyết định mô hình lớn cỡ nào chạy được. Mô hình thường được nén (lượng tử hoá, quantization) để giảm dung lượng; mức nén phổ biến 4-bit cần khoảng 0,6GB VRAM cho mỗi tỷ tham số, cộng thêm phần bộ nhớ cho ngữ cảnh (độ dài cuộc hội thoại).

VRAMChạy được (ước tính, nén 4-bit)Phù hợp
8GBMô hình 7–8 tỷ tham sốTác vụ chuyên biệt, chat cơ bản
12GBMô hình 12–14 tỷ tham sốChat, tóm tắt, tạo ảnh cơ bản
16GBMô hình 14 tỷ thoải mái; mô hình 27 tỷ nếu dùng kỹ thuật nén mớiTrợ lý lập trình, agent, tạo ảnh
24GBMô hình 27–32 tỷ tham sốCông việc nặng, ngữ cảnh dài
32GB trở lênMô hình 32 tỷ với ngữ cảnh rất dài, hoặc chạy song song nhiều phiênNhiều agent cùng lúc

Trước đây, quy tắc chung là muốn chạy AI "làm việc thật" cần card 24GB trở lên. Các kỹ thuật nén mới đang kéo ngưỡng này xuống 16GB, như thử nghiệm dưới đây cho thấy.

Cách tự tính VRAM chi tiết cho từng mô hình, kèm dung lượng thật của các bản nén phổ biến, xem bài Cần bao nhiêu VRAM để chạy AI trên máy.

Thử nghiệm thực tế: RTX 5060 Ti 16GB so với RTX 5090 32GB

Trong video "16GB Is All You Need for Serious AI" (tháng 9/2026), Manolo Remiddi so sánh hai máy chạy cùng một mô hình Qwen 27 tỷ tham số, dùng llama.cpp:

  • Mô hình: bản nén không đồng đều GSQ + RCO của nhóm ISTA-DASLab. Mỗi phần của mô hình được nén ở mức khác nhau — nén mạnh chỗ ít quan trọng, giữ chất lượng chỗ quan trọng — trung bình khoảng 3,44 bit mỗi trọng số. File chỉ còn khoảng 11,8GB, trong khi chất lượng được mô tả là gần bằng bản chưa nén.
  • Tăng tốc bằng MTP (multi-token prediction — dự đoán nhiều token một lượt), tốn thêm khoảng 0,35GB VRAM.
RTX 5060 Ti 16GBRTX 5090 32GB
Băng thông VRAM448 GB/s1.792 GB/s
Tốc độ sinh chữkhoảng 42,5–45,6 token/giâykhoảng 136 token/giây
Độ dài ngữ cảnh64.000 token262.000 token, 2 phiên chạy song song
VRAM sử dụngkhoảng 15,1 / 15,9GB—
Giá tham khảo cả máykhoảng 1.500 USDkhoảng 7.000 USD

Với tác vụ AI agent — tự mở ba trang web, lấy dữ liệu và viết file báo cáo HTML — RTX 5060 Ti hoàn thành được việc, dù chậm hơn. Theo tác giả, với việc nhỏ gần như không có khác biệt về kết quả; lợi thế của RTX 5090 là ngữ cảnh dài hơn, nên làm việc dài hơn mà không phải tóm tắt lại hội thoại. Điểm trừ của card rẻ là quạt kêu to và rít hơn khi chạy tải nặng.

Tác giả cũng nhắc một so sánh đáng chú ý: băng thông VRAM của RTX 5060 Ti cao hơn khoảng 50–60% so với máy AI chuyên dụng NVIDIA DGX Spark (dùng bộ nhớ hợp nhất dung lượng lớn nhưng chậm hơn). Với mô hình vừa trong 16GB, card nhỏ có VRAM nhanh sinh chữ nhanh hơn.

Lưu ý: thử nghiệm này chạy trên máy bàn, không phải eGPU. Nhưng theo phân tích ở phần trên, khi mô hình 11,8GB đã nằm trong VRAM, tốc độ sinh chữ qua eGPU OCuLink sẽ không khác nhiều.

Vì sao RTX 5060 Ti 16GB hợp làm eGPU cho AI?

  • Theo tác giả video, đây là card NVIDIA rẻ nhất có 16GB VRAM, lại dùng được CUDA — nền tảng được phần mềm AI hỗ trợ rộng nhất.
  • Tiêu thụ chỉ khoảng 180W, nguồn 450–550W là đủ, vừa với hầu hết hộp eGPU (xem cách chọn nguồn cho eGPU).
  • Card chỉ dùng 8 làn PCIe. Khi gắn eGPU còn 4 làn, game bị ảnh hưởng rõ (xem bài làn PCIe và eGPU), nhưng với AI chạy trong VRAM thì thiệt hại ít hơn nhiều.

NVIDIA, AMD hay Intel cho AI qua eGPU?

  • NVIDIA: dùng CUDA, gần như mọi phần mềm AI chạy được ngay. Lựa chọn ít rắc rối nhất.
  • AMD: dùng ROCm hoặc Vulkan. llama.cpp, Ollama, LM Studio đã hỗ trợ tốt; một số công cụ tạo ảnh và huấn luyện vẫn cần cài đặt thêm. Card AMD thường nhiều VRAM hơn ở cùng mức giá.
  • Intel Arc: giá rẻ, VRAM khá, chạy được qua Vulkan hoặc SYCL, nhưng hệ sinh thái phần mềm hẹp nhất.

Nếu dùng máy Mac chip Apple, eGPU không được macOS hỗ trợ cho đồ hoạ — xem bài Razer Core X và Mac.

Câu hỏi thường gặp

eGPU có chạy được ChatGPT trên máy không?
ChatGPT chỉ chạy trên máy chủ của OpenAI. Nhưng eGPU chạy được các mô hình mở tương tự như Qwen, Gemma, Llama, DeepSeek qua Ollama hoặc LM Studio, hoàn toàn trên máy của bạn.

Chạy AI qua eGPU chậm hơn máy bàn bao nhiêu?
Khi mô hình nằm gọn trong VRAM và dùng llama.cpp, tốc độ sinh chữ qua OCuLink gần như ngang máy bàn. Chậm hơn rõ khi tải mô hình, khi mô hình vượt VRAM, hoặc khi ghép nhiều card. Kết nối Thunderbolt 3/4 và một số phần mềm có thể chậm hơn đáng kể.

Card 8GB có chạy AI được không?
Được, với mô hình 7–8 tỷ tham số cho tác vụ đơn giản hoặc chuyên biệt. Muốn dùng trợ lý lập trình hoặc agent, nên có từ 16GB.

Nên dùng OCuLink hay Thunderbolt cho AI?
OCuLink nhanh nhất khi tải mô hình và khi ghép nhiều card. Nếu chỉ chạy một mô hình vừa VRAM, Thunderbolt 5 hay USB4 cũng dùng tốt.

VRAM hay sức mạnh card quan trọng hơn cho AI?
VRAM quyết định chạy được mô hình nào; băng thông VRAM quyết định chạy nhanh cỡ nào. Card nhiều VRAM nhưng yếu vẫn hơn card mạnh mà không đủ VRAM.

Đọc thêm

Nguồn tham khảo

  • Video "16GB Is All You Need for Serious AI" của Manolo Remiddi: YouTube và bài viết chi tiết
  • Thử nghiệm TensorRT-LLM trên eGPU Thunderbolt 3: Jan
  • Tóm tắt thử nghiệm OCuLink và PCIe với LLM của Alex Ziskind: Lilys
Tags:

Đăng nhận xét

0Nhận xét

Đăng nhận xét (0)

#buttons=(Tôi đã hiểu!) #days=(20)

Trang web của chúng tôi sử dụng cookie để nâng cao trải nghiệm của bạn. Xem điều khoản
Ok, Go it!