Trong kỷ nguyên AI bùng nổ, người dùng ngày càng lo ngại về quyền riêng tư, chi phí hạ tầng và độ trễ mạng. LFM2.5-2.6B – một mô hình ngôn ngữ nhỏ gọn do LiquidAI phát triển – đang mở ra hướng đi mới: đưa tác nhân AI cục bộ đến mọi thiết bị, từ laptop, điện thoại đến máy tính để bàn, mà không cần gửi dữ liệu lên đám mây. Với khả năng gọi công cụ, xử lý tác vụ đa bước và tốc độ suy luận ấn tượng dưới 2.5 GB RAM, mô hình này không chỉ tiết kiệm chi phí mà còn bảo vệ thông tin nhạy cảm – điều đặc biệt quan trọng với thị trường Việt Nam.
Tại sao “tác nhân AI cục bộ” lại quan trọng với người dùng Việt?
Người dùng Việt thường xuyên sử dụng thiết bị di động cấu hình trung bình, nơi băng thông internet đôi khi chập chờn hoặc tốn kém. Trong bối cảnh đó, việc chạy AI hoàn toàn trên thiết bị (on-device AI) mang lại ba lợi ích then chốt: hoạt động offline, bảo mật dữ liệu cá nhân và loại bỏ phụ thuộc vào máy chủ nước ngoài. Điều này rất phù hợp với doanh nghiệp khởi nghiệp, ứng dụng giáo dục nội địa hoặc sản phẩm IoT yêu cầu phản hồi thời gian thực mà không vi phạm quyền riêng tư.
Hơn nữa, chi phí vận hành AI đám mây có thể tăng vọt khi lượng người dùng mở rộng. Với tác nhân AI cục bộ như LFM2.5-2.6B, nhà phát triển có thể triển khai hàng loạt mà không lo “hóa đơn suy luận” – một rào cản lớn với startup tại thị trường mới nổi.
Kiến trúc và quy trình huấn luyện đặc biệt
LFM2.5-2.6B không phải là mô hình ngôn ngữ thông thường. Nó được thiết kế từ đầu để đóng vai trò một tác nhân – tức là hệ thống có thể lập kế hoạch, gọi công cụ bên ngoài và thực hiện chuỗi hành động liên tiếp để hoàn thành mục tiêu. Để đạt được điều này, LiquidAI áp dụng chiến lược huấn luyện bốn giai đoạn:
- Tinh chỉnh có giám sát (SFT): Hai vòng SFT tập trung vào dữ liệu thực tế từ các nền tảng tác nhân phổ biến, bao gồm gọi API, tìm kiếm web và luồng tương tác đa bước.
- Giáo viên chuyên ngành: Mỗi lĩnh vực (toán học, lập trình, gọi công cụ…) có một mô hình “giáo viên” riêng, được huấn luyện sâu trên dữ liệu chất lượng cao.
- Chưng cất đa miền (MOPD): Kiến thức từ các giáo viên được hợp nhất vào một mô hình “học sinh” duy nhất – chính là LFM2.5-2.6B – giúp cân bằng hiệu năng trên nhiều tác vụ.
- Học tăng cường hướng tác nhân (Agentic RL): Mô hình được huấn luyện trong môi trường mô phỏng, nơi nó tương tác với nhiều công cụ và hệ thống nhắc lệnh qua nhiều lượt, học cách tối ưu hành vi dựa trên phần thưởng.
Hiệu năng ấn tượng dù kích thước nhỏ
Dù chỉ có 2.6 tỷ tham số – nhỏ hơn 4 lần so với nhiều đối thủ – LFM2.5-2.6B đạt điểm cạnh tranh hoặc vượt trội trong hầu hết bài kiểm tra về tuân thủ lệnh, sử dụng công cụ và tác vụ đa bước. Duy nhất trong lĩnh vực lập trình, các mô hình lớn hơn (7B–13B) vẫn giữ lợi thế rõ rệt, do yêu cầu kiến thức chuyên sâu và khả năng sinh mã phức tạp.
Bảng so sánh hiệu năng trên các chuẩn đánh giá
| Chuẩn đánh giá | LFM2.5-2.6B | Gemma-4-E2B-it (5.1B) | Qwen3.5-9B |
|---|---|---|---|
| AIME25 (Toán) | 51.87 | 26.33 | 56.07 |
| IFBench (Tuân thủ lệnh) | 59.17 | 34.08 | 56.47 |
| ToolSandbox (Gọi công cụ) | 77.83 | 52.40 | 76.44 |
| LiveCodeBenchv6 (Lập trình) | 59.41 | 54.92 | 69.86 |
| Claw-Eval (Tác vụ tác nhân) | 62.85 | 53.14 | 66.53 |
Nhìn vào bảng, có thể thấy LFM2.5-2.6B dẫn đầu tuyệt đối ở các tiêu chí cốt lõi của tác nhân AI cục bộ: tuân thủ lệnh và gọi công cụ. Đây chính là nền tảng để xây dựng trợ lý thông minh có thể tương tác với phần mềm, API hoặc thiết bị ngoại vi mà không cần can thiệp thủ công.

Tốc độ suy luận: Nhanh trên cả CPU và GPU
Một trong những điểm mạnh hiếm có của LFM2.5-2.6B là khả năng chạy mượt trên phần cứng phổ thông nhờ kiến trúc LFM2 hiệu quả:
- Trên chip Apple M5 Max: 220 token/giây
- Trên CPU AMD Ryzen AI Max+ 395: 113 token/giây
- Trên điện thoại: đạt ~30 token/giây – đủ để hỗ trợ tương tác thời gian thực
- Trên GPU H100: xử lý gần 15.000 token/giây ở chế độ đa luồng, tương đương ~1.3 tỷ token/ngày
Đặc biệt, mô hình tiêu thụ dưới 2.5 GB RAM – mức thấp enough để chạy trên hầu hết laptop văn phòng và smartphone đời mới. Điều này mở ra khả năng tích hợp AI vào ứng dụng di động mà không làm hao pin hay gây giật lag.
Hướng dẫn sử dụng cơ bản cho nhà phát triển
LFM2.5-2.6B tương thích với thư viện transformers phiên bản 5.0.0 trở lên. Nhà phát triển chỉ cần vài dòng mã Python để tải và chạy mô hình. Ngoài ra, LiquidAI cung cấp bản demo WebGPU chạy trực tiếp trên trình duyệt – không cần cài đặt – cho phép thử nghiệm tác nhân AI cục bộ nghiên cứu tự động ngay lập tức.
Mô hình cũng hỗ trợ các framework suy luận phổ biến như llama.cpp, MLX, vLLM, SGLang và ONNX, giúp tích hợp linh hoạt vào hệ sinh thái hiện có.
Câu hỏi thường gặp (FAQ)
LFM2.5-2.6B có miễn phí không?
Có. Cả phiên bản đã tinh chỉnh (LFM2.5-2.6B) và phiên bản gốc (LFM2.5-2.6B-Base) đều được phát hành công khai trên Hugging Face. Người dùng cần kiểm tra giấy phép cụ thể tại trang mô hình.
Có hỗ trợ tiếng Việt không?
Nguồn không đề cập đến dữ liệu huấn luyện đa ngôn ngữ hay hiệu năng trên tiếng Việt. Khả năng xử lý tiếng Việt cần được kiểm chứng thực tế.
Phù hợp với ứng dụng nào?
Lý tưởng cho ứng dụng cần gọi API/công cụ bên ngoài, xử lý tác vụ theo nhiều bước, yêu cầu riêng tư dữ liệu và hoạt động offline – ví dụ: trợ lý nghiên cứu, tự động hóa văn phòng cục bộ, hoặc tích hợp vào thiết bị IoT.
Nên tránh dùng trong trường hợp nào?
Nếu ứng dụng đòi hỏi sinh mã phức tạp hoặc lập trình chuyên sâu, các mô hình lớn hơn (7B–13B tham số) vẫn là lựa chọn tốt hơn.
Nguồn: Hugging Face.







