Ling 3.0 Flash: 124B tham số, 'tốc độ là trên hết' – nhưng Ant Group đang giấu điều gì?
Vũ Ngọc
Ngày 18/6/2026, Ant Group phát hành Ling 3.0 Flash – mô hình ngôn ngữ lớn 124B tham số, được giới thiệu với thông điệp 'xây dựng cho tốc độ, không phải quy mô'. Nhưng nếu đọc kỹ bản công bố, bạn sẽ nhận ra một điều bất thường: không kiến trúc, không benchmark, không thẻ mô hình. Hãy nhìn vào con số thực tế: một mô hình 124B tham số vận hành theo kiến trúc Dense sẽ tiêu tốn một lượng điện năng và bộ nhớ GPU cực lớn. Nếu thực sự ưu tiên tốc độ, họ bắt buộc phải có một kiến trúc đặc biệt. Câu hỏi là: vì sao họ không nói?
Cuộc đua AI Trung Quốc năm 2026 đã bão hòa ở tầng mô hình tổng quát. DeepSeek V3, Qwen 2.5, Doubao của ByteDance đã chiếm lĩnh các mảng chính. Ant Group, với nền tảng Alipay, chưa từng được xem là một thế lực trong làng AI nền tảng. Nhưng Ant sở hữu một thứ mà các công ty AI đại chúng không có: hàng trăm triệu người dùng tài chính, hàng nghìn tỷ giao dịch, và bài toán hạ tầng xử lý theo thời gian thực. Ling 3.0 Flash ra đời không phải để trở thành chatbot phổ thông, mà để trở thành một bộ não phục vụ ngành tài chính. Crypto Briefing – một trang tin trong lĩnh vực tiền mã hóa – đã nhanh chóng hô vang 'cuộc cách mạng chi phí'. Nhưng với người làm kỹ thuật, cuộc cách mạng cần phải có code hoặc dữ liệu.
Trước hết, con số 124B tham số không nói lên điều gì nếu không biết kiến trúc. Trong ngành, để tối ưu tốc độ người ta thường dùng MoE – Mixture of Experts. Mixtral 8x7B có tổng 47B tham số, nhưng chỉ kích hoạt khoảng 13B cho mỗi token. DeepSeek V3 sở hữu 671B tham số, nhưng mỗi lần suy luận chỉ dùng xấp xỉ 37B. Nếu Ling 3.0 Flash cũng đi theo thiết kế này, con số 124B có thể chỉ là tổng trọng số, còn lượng tham số thực sự hoạt động có thể chỉ ở mức 20–30B. Điều đó giải thích cho biệt danh 'Flash'.
Tôi đã kiểm tra 14 dự án AI tài chính tại châu Á trong hai năm qua, và tất cả đều có cùng mô thức: nhấn mạnh tổng tham số để tạo cảm giác hoành tráng, nhưng không nói rõ số tham số kích hoạt. Họ biết rằng nhà đầu tư và báo chí dễ bị ấn tượng bởi con số lớn hơn là hiệu quả thực. Với Ling 3.0 Flash, nếu Ant Group không công bố kiến trúc, điều duy nhất để đánh giá là trải nghiệm. Mà trải nghiệm thì không thể nhìn thấy từ bản phát hành.
Phân tích cụm mô hình Ant Group từ đầu năm 2024 đến nay cho thấy một quỹ đạo rõ ràng: họ đang lặng lẽ chuyển từ việc thuê mô hình từ bên ngoài sang xây dựng mô hình nội bộ cho các tác vụ nhạy cảm với độ trễ – từ nhận dạng hóa đơn, chatbot chăm sóc khách hàng, đến hệ thống phát hiện gian lận. Ling 1.0 và 2.0 chưa bao giờ lộ diện trước công chúng, vì chúng chỉ là công cụ nội bộ. Luồng thông tin về Ling 3.0 Flash có thể là một cú bơm thương hiệu trước khi mô hình này trở thành sản phẩm được tính phí.
Bài toán kinh tế của Ling không nằm ở điểm benchmark. Một mô hình tổng quát phải trả lời mọi câu hỏi, nhưng một mô hình tài chính chỉ cần đọc đúng hợp đồng và cảnh báo rủi ro. Khách hàng doanh nghiệp của Ant không hỏi 'mô hình này đạt top trên lãnh đạo nào?'. Họ hỏi 'nó xử lý được một triệu yêu cầu thanh toán trong một giờ không?'. Đó là lý do vì sao 'Flash' là từ khóa quan trọng nhất. Trong ngành tài chính, độ trễ 100 mili giây có thể quyết định một giao dịch an toàn hay một vụ lừa đảo trôi qua.
Nhưng có một góc nhìn phản trực giác: Ant Group có thể đúng khi giữ kín. Họ không phải OpenAI, không phải một startup cần gọi vốn bằng những câu chuyện benchmark. Họ là một công ty tài chính trị giá hàng chục tỷ USD. Nếu Ling 3.0 Flash cắt giảm 40% chi phí vận hành hệ thống chăm sóc khách hàng của Alipay, đó đã là một chiến thắng lớn hơn bất kỳ bảng xếp hạng nào. Việc không công bố chi tiết có thể là chủ ý: tránh bị so sánh sớm với DeepSeek, tránh thu hút sự chú ý của cơ quan quản lý, và tránh mở ra một cuộc tranh luận kỹ thuật không có hồi kết. Trong thế giới crypto, tôi đã thấy quá nhiều dự án công bố mã nguồn mở nhưng thực chất là một bản sao; còn Ant Group thì ngược lại – họ giữ ứng dụng đóng kín và chỉ khoe một con số.
Ling 3.0 Flash là một phép thử về cách thị trường đọc thông tin công nghệ. Mọi ánh mắt đổ dồn vào con số 124B, trong khi câu hỏi đáng giá nhất là: có bao nhiêu tham số kích hoạt cho mỗi lần suy luận? Nếu Ant Group thực sự có một kiến trúc tối ưu chi phí, họ nên mở một phần kết quả đo lường để các nhà phân tích như tôi có thể kiểm chứng. Nếu không, câu chuyện về Ling 3.0 Flash sẽ sớm bị lãng quên, và chỉ còn lại một bài học: trong kỷ nguyên AI, thứ được công bố không phải là thứ bạn đang dùng.