Intermediate ⏱️ 12 phút đọc

Chạy Qwen3.8-Flash-Next trên PC với Strata: hướng dẫn Windows, Linux và API

Cài Qwen3.8-Flash-Next bằng Strata, chọn bản lượng tử phù hợp RAM/VRAM, chat tại localhost và kết nối ứng dụng qua API tương thích OpenAI.

A
AIDaLat Editorial
• • 👀 Đang tải...
Chạy Qwen3.8-Flash-Next trên PC với Strata: hướng dẫn Windows, Linux và API
Công cụ trong bài: Strata Qwen3.8-Flash-Next NVIDIA GPU Python

Một mô hình 125 tỷ tham số không nhất thiết phải nằm hoàn toàn trong VRAM của GPU. Strata là engine suy luận mã nguồn mở hướng đến việc chạy Qwen3.8-Flash-Next trên PC bằng cách phân chia công việc giữa GPU, CPU, RAM và SSD. Dự án cung cấp trình cài đặt cho Windows/Linux, giao diện chat tại localhost và API tương thích OpenAI/Anthropic.[1]

Phạm vi bài viết: tổng hợp và diễn giải README cùng docs/DETAILS.md trên nhánh main, truy cập ngày 01/10/2026. AIDaLat đã đối chiếu lệnh với tài liệu, chưa chạy suy luận hay tự đo benchmark trên máy có GPU. Tài liệu nhánh main có thể thay đổi và có một số mục chưa đồng bộ; hãy kiểm tra release và hướng dẫn hiện hành trước khi cài.

1. Strata làm điều đó như thế nào?

Theo tác giả, mô hình có 24.576 expert và mỗi token sử dụng một phần nhỏ trong số đó. GPU giữ phần tính toán chung cùng các expert được dùng thường xuyên; RAM chứa các expert khác, CPU xử lý phần thiếu trên GPU; một bảng tra cứu lớn nằm trên SSD. Strata còn dùng cơ chế dự đoán rồi kiểm tra các token tiếp theo để tăng tốc sinh câu trả lời.[1]

Vì vậy, “chạy mô hình 125B trên GPU nhỏ” không có nghĩa là chỉ cần một card đồ họa. RAM hệ thống, CPU, ổ đĩa và đường truyền PCIe đều tham gia. Đây cũng không phải giải pháp CPU-only dành cho máy không có GPU phù hợp.[1][2]

2. Kiểm tra phần cứng trước khi tải

Cấu hình nền tảng trong tài liệu chi tiết của dự án:[2]

Thành phầnKhuyến nghị / yêu cầu trong tài liệu
GPUNVIDIA RTX 20/30/40/50, ưu tiên từ 12 GB VRAM; 8 GB được ghi là có thể chạy nhưng chậm
RAM64 GB được khuyến nghị; bản lượng tử và chế độ low-RAM ảnh hưởng khả năng chạy
CPUx86-64 có AVX2; AVX-512 có thể có lợi cho một số đường tính toán
Driver NVIDIAPhiên bản 580 trở lên theo DETAILS.md
Hệ điều hànhWindows 10/11 hoặc Linux; Ubuntu 22.04/24.04 được mô tả hỗ trợ cài tự động
Ổ đĩaNVMe SSD được khuyến nghị; cần tính cả model, MTP và dữ liệu chuẩn bị

Đừng chỉ nhìn mốc “~80 GB trống”. Tài liệu còn liệt kê MTP khoảng 6 GB, phần vision thêm khoảng 1 GB và bản sao expert khoảng 40 GB trong trường hợp Q2_0 trên CPU AVX-512. Thư mục dữ liệu có thể đạt 70–120 GB tùy cấu hình. Khuyến nghị thực hành của bài viết: để dư dung lượng đáng kể thay vì cài trên ổ sắp đầy.[2]

Bạn có thể kiểm tra GPU và driver bằng:

nvidia-smi

Nếu máy không có GPU NVIDIA tương thích, đừng tiếp tục hướng dẫn NVIDIA này. README có nhánh AMD HIP thử nghiệm trên Linux, nhưng đó là lộ trình riêng, không phải bảo đảm mọi GPU AMD đều chạy được.[1]

Chọn bản model nào?

README liệt kê các mức dung lượng RAM+VRAM và đánh giá định tính như sau. Đây là số liệu của dự án, không phải lượng VRAM tối thiểu hay benchmark do AIDaLat đo.[1]

Bản lượng tửRAM+VRAM trong bảng READMEĐịnh hướng lựa chọn
Q2_037,6 GBƯu tiên tốc độ và tiết kiệm bộ nhớ
IQ2_XS39,2 GBLựa chọn được README khuyến nghị
IQ3_XXS47,0 GBĐổi tốc độ/bộ nhớ lấy chất lượng
IQ3_S54,8 GBMức chất lượng cao nhất trong bảng của tác giả

Với đường chạy thông thường, README khuyên dự trù RAM bằng shard 1 cộng khoảng 10 GB cho hệ điều hành và ứng dụng; 64 GB RAM phù hợp hơn, còn 48 GB hướng đến Q2_0/IQ2_XS. Tài liệu mới cũng mô tả low-RAM mode, nơi GPU lớn có thể giảm phần expert cần giữ trong RAM. Không nên suy ra cấu hình chạy được bằng cách cộng RAM và VRAM đơn giản.[1][2]

Nếu chủ yếu viết code hoặc chỉ có 32–48 GB RAM, hãy xem lựa chọn Coder trong trình cài. Đây là biến thể đã loại bớt expert, không phải bản đầy đủ lượng tử hóa theo cách thông thường; README lưu ý nó yếu hơn ngoài lĩnh vực coding. Swift 1.5 lại là fine-tune với thời gian suy nghĩ ngắn hơn và có giấy phép model riêng.[1]

Lựa chọn khởi đầu của bài viết: bản gốc Qwen3.8-Flash-Next, IQ2_XS, context theo gợi ý của installer và chưa bật vision. Chỉ tăng context hoặc đổi bản sau khi cấu hình này chạy ổn định.

3. Cài trên Windows

Bước 1: Lấy mã nguồn

Mở repository Strata, chọn Code → Download ZIP, rồi giải nén. Nếu đã có Git, có thể dùng:

git clone https://github.com/Niko1221/Strata.git
cd Strata

Đây là mã nguồn bên thứ ba sẽ tải thêm thành phần và model. Hãy xem nội dung script, release và giấy phép trước khi chạy; không mặc định cấp quyền Administrator hoặc bỏ qua cảnh báo bảo mật.

Bước 2: Chạy trình cài

Nhấp đúp START-HERE.bat. Trong PowerShell, chạy:

.\START-HERE.bat

Installer hỏi model, bản lượng tử, context và khả năng đọc ảnh. README còn có tùy chọn experimental speed projection, mặc định tắt; nên giữ tắt ở lần cài đầu vì nó thay đổi cách model trả lời và không chỉ là một công tắc tối ưu vô hại.[1][2]

Nếu muốn chỉ định bản IQ2_XS và context 32K thay vì trả lời menu, tài liệu có các cờ tương ứng. Ví dụ PowerShell điều chỉnh từ lệnh mẫu của dự án:[2]

.\START-HERE.bat --model IQ2_XS --context 32768 --vision no --yes

Lưu ý: 32K trong ví dụ không phải mức tối ưu cho mọi card. Chọn context theo VRAM và gợi ý thực tế của installer.

Bước 3: Chờ tải và khởi động

Dự án tự thiết lập môi trường Python riêng, thư viện CUDA, engine và model; nếu không có engine dựng sẵn phù hợp, nó có thể đề nghị cài công cụ build. Tải model lần đầu khá lớn và tải gián đoạn có thể tiếp tục khi chạy lại installer.[1][2]

README cảnh báo PC có thể chậm hoặc tạm ngừng phản hồi khoảng 1–3 phút khi nạp và khóa bộ nhớ. Đọc tiến trình trong cửa sổ log; đừng liên tục đóng rồi mở lại. Nếu tình trạng kéo dài bất thường, xem phần xử lý lỗi bên dưới.[1]

Khi model sẵn sàng, mở:

http://127.0.0.1:8080

Giao diện có Chat, Monitor và About. Các lần sau chạy lại START-HERE.bat; đóng cửa sổ server để dừng model.[1][2]

4. Cài trên Linux và lưu ý WSL

Sau khi lấy mã nguồn, chạy script chính:[2]

git clone https://github.com/Niko1221/Strata.git
cd Strata
./setup.sh

Nếu bản ZIP không giữ quyền thực thi, cấp quyền cho script rồi chạy lại:

chmod +x setup.sh
./setup.sh

Installer hỏi các lựa chọn tương tự Windows. Tài liệu cho biết Ubuntu có thể dùng sudo apt để cài Python hoặc công cụ biên dịch nếu cần; hãy đọc lời nhắc và chỉ cấp quyền cho bước bạn hiểu.[2]

WSL đã được tác giả ghi nhận hoạt động trên Ubuntu 24.04 nhưng có giới hạn pin RAM của driver: KV streaming bị tắt, KV cache ở VRAM và expert được chuyển từ RAM không pin, làm prompt chậm hơn Linux native. WSL không tạo ra GPU hay bộ nhớ phần cứng còn thiếu.[2]

Chat trong terminal là tùy chọn:[1][2]

# Linux
.venv/bin/python chat.py
# Windows
.venv\Scripts\python chat.py

5. Xác minh server trước khi nối ứng dụng

Khi server đã khởi động, kiểm tra health và danh sách model. Hai endpoint được tài liệu liệt kê là /health và /v1/models.[2]

# Linux / WSL
curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/v1/models
# PowerShell: dùng curl.exe để tránh nhầm với alias
curl.exe http://127.0.0.1:8080/health
curl.exe http://127.0.0.1:8080/v1/models

Nếu đã cấu hình API key, gửi key theo cơ chế xác thực của server. Chưa kết nối được thì kiểm tra log, cổng và trạng thái nạp model trước khi sửa ứng dụng phía client. Bài viết không đưa JSON đầu ra mẫu vì chưa chạy server để xác nhận phản hồi thực tế.

6. Gọi bằng Python qua API tương thích OpenAI

Base URL theo tài liệu là http://127.0.0.1:8080/v1. Khi server chưa bật xác thực, ví dụ của dự án dùng API key giả none; nếu đã bật xác thực, phải thay bằng key thật.[2]

Tạo môi trường client riêng:

python -m venv client-env
# Linux / WSL
source client-env/bin/activate
pip install openai

Trên PowerShell, bước kích hoạt tương ứng là client-env\Scripts\Activate.ps1. Sau đó lưu đoạn sau thành test_strata.py:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8080/v1",
    api_key="none",  # Thay bằng key thật nếu server bật xác thực
)

response = client.chat.completions.create(
    model="strata",
    messages=[{
        "role": "user",
        "content": "Giải thích MoE bằng tiếng Việt, trong 5 câu ngắn.",
    }],
    reasoning_effort="low",
    max_tokens=1024,
)
print(response.choices[0].message.content)

Chạy python test_strata.py. Đoạn này được điều chỉnh từ ví dụ SDK và tùy chọn reasoning_effort trong tài liệu, chưa được kiểm thử suy luận bởi AIDaLat.[2]

Với ứng dụng chat khác, chọn provider OpenAI-compatible, nhập base URL trên và dùng model theo cấu hình ứng dụng hoặc danh sách /v1/models. Strata cũng cung cấp endpoint Anthropic Messages tại /v1/messages; không nên mặc định tương thích hoàn toàn với mọi tính năng của dịch vụ cloud.[1][2]

7. Tối ưu sau khi chạy ổn định

  • Thinking: giao diện có off/low/medium/high; API dùng none/low/medium/high. Bắt đầu với low cho tác vụ đơn giản, tăng khi cần suy luận khó.[1][2]
  • Context: context dài tiêu tốn tài nguyên; ưu tiên gợi ý installer, không chọn mức lớn nhất chỉ vì menu có. Các mức 384K/512K trong README là mở rộng thử nghiệm bằng RoPE scaling, không phải context huấn luyện gốc.[1]
  • Vision: chỉ bật khi cần đọc ảnh; tính thêm dung lượng và tài nguyên của image encoder.[1][2]
  • Calibrate: tác giả cung cấp công cụ đo một số thiết lập trên chính PC, thay vì đoán cấu hình tối ưu.[2]
.\START-HERE.bat --calibrate
./setup.sh --calibrate

Đổi cấu hình hoặc cài thêm model bằng START-HERE.bat --setup, SETUP.bat hoặc ./setup.sh --setup. Dữ liệu model được giữ trong Strata-data cạnh thư mục Strata và có thể đổi vị trí bằng --data-dir.[1]

Tốc độ nên kỳ vọng thế nào?

README công bố kết quả trên RTX 5070 12 GB + Ryzen 5 7600 + 64 GB RAM: Q2_0 khoảng 93 token/s cho chat ngắn, IQ2_XS khoảng 79 token/s, IQ3_XXS khoảng 62 token/s và IQ3_S khoảng 53 token/s. Ở context 128K, các giá trị được báo cáo giảm tương ứng còn 74/63/49/46 token/s.[1]

Đây là benchmark do tác giả công bố trên một cấu hình cụ thể, không phải cam kết cho mọi PC. Không so sánh trực tiếp tốc độ đọc prompt với tốc độ sinh đáp án, và không áp dụng quy đổi “token ≈ từ” tiếng Anh cho tiếng Việt một cách máy móc.

8. Xử lý lỗi thường gặp

Hiện tượngHướng xử lý theo tài liệu
Tải model bị ngắtChạy lại launcher để tiếp tục tải
Driver quá cũCập nhật driver NVIDIA và khởi động lại máy
Máy chậm, ổ đĩa hoạt động liên tụcĐóng ứng dụng chiếm RAM; thử Q2_0/IQ2_XS hoặc xem low-RAM mode
Engine dừng bất ngờKiểm tra thiếu RAM và log; giảm mức model hoặc tải bộ nhớ
Cổng 8080 đã được dùngKiểm tra Strata đã chạy chưa; có thể đổi bằng --port 8081
Prompt vượt contextTạo cuộc chat mới hoặc cấu hình lại context

README lưu ý nếu máy vẫn treo sau khoảng 10 phút thì khởi động lại, đóng ứng dụng khác và thử bản nhỏ hơn; khi báo lỗi cho dự án hãy đính kèm strata-<model>.log. Trước khi chia sẻ log, tự kiểm tra và che dữ liệu nhạy cảm.[1][2]

9. Bảo mật và quyền riêng tư

Giữ server ở 127.0.0.1 nếu chỉ dùng trên máy cá nhân. Muốn truy cập từ thiết bị khác cần cấu hình host mạng và API key; không mở cổng công khai khi chưa thiết lập xác thực và giới hạn truy cập. Tài liệu Docker cũng cảnh báo server container mặc định lắng nghe trên 0.0.0.0.[1][2]

Chat trong web app được giữ ở local storage của trình duyệt, không phải lịch sử lưu trên server. Xóa dữ liệu trang hoặc đổi trình duyệt có thể mất lịch sử. Khi nối agent và công cụ bên ngoài, dữ liệu có thể đi qua những công cụ đó; “model chạy local” không tự động làm toàn bộ quy trình trở thành offline.[1]

Strata dùng giấy phép MIT, nhưng giấy phép engine và giấy phép model là hai việc khác nhau. README ghi rõ mỗi bộ model/fine-tune có giấy phép riêng; cần đọc trước khi dùng thương mại hoặc phân phối lại.[1]

Kết luận

Điểm hấp dẫn của Strata là biến cả PC thành hệ thống suy luận thay vì buộc model nằm hết trong VRAM. Lộ trình dễ kiểm soát nhất: kiểm tra GPU/RAM/SSD → chọn IQ2_XS hoặc bản phù hợp → chạy installer → thử Chat → kiểm tra health/models → nối API → tối ưu sau.

Nếu chưa có phần cứng phù hợp, đừng tải hàng chục GB chỉ vì tiêu đề nhắc GPU 8 GB. Hãy đối chiếu yêu cầu hiện hành, chọn máy cloud có GPU/RAM đủ hoặc dùng một model nhỏ hơn. Với phần cứng đáp ứng, bài này là checklist triển khai; kết quả tốc độ và chất lượng vẫn cần đo trên chính môi trường của bạn.

Sources

[1] https://github.com/Niko1221/Strata [2] https://github.com/Niko1221/Strata/blob/main/docs/DETAILS.md

✉️ Bản Tin AI Hàng Tuần

Đón Đầu Bước Tiến Trí Tuệ Nhân Tạo

Nhận bản tóm tắt các mô hình AI mới nhất, bài hướng dẫn kỹ thuật độc quyền và mã nguồn mẫu được gửi thẳng vào hộp thư mỗi thứ Hai. Không spam, hủy bất kỳ lúc nào.

Được bảo vệ bởi Cloudflare Edge. Dữ liệu của bạn luôn an toàn.