
Hỡi các đồng đạo cào phím suốt ngày cúng tiền cho OpenAI hay Anthropic, đã bao giờ các ông xót ví khi nhìn cái hóa đơn API cuối tháng chưa? Tôi cá là có. Rồi sau đó, các ông hăm hở mò mẫm tự setup LLM chạy local trên con Macbook M-series của mình, để rồi nhận ra máy cắn RAM như nhai kẹo, quạt rú như phản lực, còn tốc độ phản hồi thì chậm như rùa bò.
Nhưng khoan, hôm nay giang hồ đang kháo nhau về một món đồ chơi mới tên là BaseRT – được quảng cáo là runtime chạy LLM nhanh nhất trên Apple Silicon, vả sấp mặt cả những tượng đài như llama.cpp hay MLX. Thực hư thế nào, hãy cùng tôi bóc tách xem đây là hàng xịn hay lại là một quả "lùa gà" công nghệ.
Mọi chuyện bắt đầu từ khi Lukas, co-founder của dự án BaseRT, đem đứa con tinh thần của mình lên Product Hunt và dõng dạc tuyên bố thiết lập một "trần hiệu năng mới" cho LLM trên chip nhà Táo. Theo lời quảng cáo và các thông số từ phía đội ngũ phát triển, con hàng này sở hữu những chỉ số nghe qua đã thấy "ảo ma Canada":
Lukas giải thích rằng, bí quyết nằm ở việc họ đã tối ưu hóa BaseRT để tận dụng triệt để kiến trúc Tensor Core mới trên dòng chip Apple Silicon, thông qua API Metal 4 Tensor mới cứng. Họ đã benchmark thành công trên 10 cấu hình khác nhau với các model quốc dân như Qwen 3/3.5/3.6, Llama 3.2, và Gemma 4, trải dài từ size tí hon 0.6B đến hàng khủng 35B tham số.
Ngay khi dự án lên sóng, cộng đồng dev đã lập tức nhảy vào mổ xẻ. Trái với những nghi ngại ban đầu, phản hồi thực tế từ những người đã trải nghiệm lại khá tích cực, dù vẫn còn nhiều thứ cần cải tiến.
Một dev xài Macbook M2 chia sẻ rằng anh ta đã cài đặt thử và kéo một model 7B về chỉ trong chưa đầy một phút. Cảm giác chạy cực kỳ mượt mà, máy mát rượi ngay cả khi đang dùng pin chứ không hề làm "nướng" chiếc laptop như các công cụ khác. Việc này giúp anh tiết kiệm được một mớ tiền hóa đơn token mà không lo chai pin Macbook.
Tuy nhiên, các cao nhân trong ngành cũng nhanh chóng đưa ra những yêu cầu mang tính thực tế cao:
Là một Senior Dev từng trải qua đủ loại sóng gió và xài qua đủ loại AI tools từ thượng vàng hạ cám, tôi thấy BaseRT thực sự là một làn gió mới đáng để anh em thử nghiệm, đặc biệt là những ai đang sở hữu Macbook M-series đời mới.
Nhưng hãy thực tế một chút: Những con số như "gấp 6 lần" thường chỉ là trong điều kiện phòng thí nghiệm lý tưởng hoặc ở một khâu cụ thể (như prefill stage). Khi chạy thực tế dài hơi, hiệu năng tổng thể còn phụ thuộc vào dung lượng RAM hợp nhất (Unified Memory) của Mac và độ lớn của model bạn chọn.
Tuy nhiên, cái hay của BaseRT là nó thúc đẩy sự cạnh tranh. Việc một bên thứ ba dám tối ưu Metal 4 để vả cả MLX của chính Apple sẽ buộc các ông lớn phải nâng cấp công cụ của mình. Nếu anh em lười setup phức tạp và muốn trải nghiệm LLM local nhanh gọn nhẹ, cứ tải về test thử. Còn nếu anh em muốn triển khai hệ thống lớn hơn không phụ thuộc phần cứng cá nhân, việc thuê một con vps chất lượng cao để deploy vẫn là giải pháp an toàn và thực dụng nhất.
Nguồn tham khảo: Product Hunt
BaseRT vừa đổ bộ Product Hunt với tuyên bố chạy LLM local trên Apple Silicon nhanh gấp 6.4 lần llama.cpp. Liệu có xịn xò con bò hay lại là quả bánh vẽ?