Chi phí sử dụng AI sắp tới sẽ giảm hay tăng?

Chi phí AI

Về chi phí AI, ban lãnh đạo luôn hỏi một câu: sang năm sẽ tốn bao nhiêu? Câu trả lời không đơn giản. Trong hai năm qua, đơn giá mỗi token đã giảm rõ rệt. Dù vậy, hóa đơn AI của nhiều doanh nghiệp vẫn tăng. Bài viết này phân tích vì sao chi phí tăng dù đơn giá giảm, cùng ba lý do khiến đơn giá có thể tăng trong thời gian tới.

Đơn giá đang giảm.
Nhưng hóa đơn vẫn tăng.

Trước hết là sự thật: đơn giá thực sự đã giảm.

Việc giảm giá là có thật. Trong một năm qua, các nhà cung cấp AI lớn đã nhiều lần hạ giá. Nguyên nhân là hiệu suất suy luận được cải thiện. Biên lợi nhuận gộp của một công ty AI lớn đã tăng từ âm 94% năm 2024 lên khoảng 60% năm 2026. Điều đáng chú ý là sự cải thiện này không đến từ việc tăng giá. Biên lợi nhuận tăng vì cùng một khối lượng công việc nay cần ít tài nguyên tính toán hơn.

-94% → khoảng 60%Biên lợi nhuận gộp của một công ty AI lớn (2024→2026)
khoảng 7,6 lầnDoanh thu quy năm của công ty đó (7 tháng gần nhất)
Không công bốLượng token có trong gói thuê bao hàng tháng

Vậy mà hóa đơn vẫn tăng.

Chi phí tăng dù đơn giá giảm là vì mức sử dụng tăng nhanh hơn tốc độ giảm giá. Doanh thu quy năm của chính công ty đó đã tăng khoảng 7,6 lần trong bảy tháng. Doanh thu tăng nhanh như vậy trong khi vẫn giảm giá nghĩa là toàn ngành đang tiêu thụ nhiều token hơn nữa. Trong nội bộ doanh nghiệp cũng vậy: nhiều người dùng hơn, nhiều việc được giao hơn, thời gian sử dụng mỗi người dài hơn. Giá giảm một nửa mà mức tiêu thụ tăng gấp ba thì hóa đơn vẫn tăng.

Càng thông minh, mỗi lần dùng càng tốn.

Đây là điểm thường bị bỏ qua. Mỗi thế hệ AI đều thông minh hơn, nhưng sự thông minh đó thể hiện thành lượng token tiêu thụ thêm. Dù bảng giá giữ nguyên, bạn vẫn trả nhiều hơn khi một công việc cần nhiều token hơn. Dưới đây là ba thay đổi đang thực sự diễn ra.

Cùng một đoạn văn nay tính thành nhiều token hơnCách đếmKhi đổi thế hệ mô hình, cách đếm token cũng có thể thay đổi. Ở một lần chuyển thế hệ, cùng một dữ liệu đầu vào bắt đầu được tính thành gấp 1 đến 1,35 lần số token so với trước. Đơn giá không đổi, nhưng hóa đơn vẫn tăng.
Suy nghĩ càng sâu, tiêu tốn càng nhiềuToken suy luậnCác mô hình gần đây có bước suy nghĩ trước khi trả lời. Bạn có thể chọn độ sâu, nhưng suy nghĩ càng sâu thì càng tiêu tốn token suy luận. Càng đòi hỏi độ chính xác, chi phí mỗi lần càng cao.
Mức tiêu thụ cho mỗi ảnh tăng khoảng 3 lầnĐầu vào hình ảnhNhờ hỗ trợ ảnh độ phân giải cao, một ảnh đã tăng từ khoảng 1.600 token lên tối đa khoảng 4.784 token. Độ chính xác tăng, nhưng chi phí xử lý cùng số lượng ảnh cao gần gấp ba.

Nói cách khác, chi phí bằng đơn giá nhân với mức tiêu thụ, và chỉ vế đầu giảm trong hai năm qua. Vế sau tăng lên khi mô hình thông minh hơn. Thấy thông báo giảm giá mà yên tâm thì còn quá sớm.

Gói thuê bao hàng tháng chỉ là điều kiện của hôm nay.

Gói thuê bao hàng tháng mang tính giá giới thiệu, dành cho giai đoạn AI bén rễ vào công việc. Có ba sự thật cần nắm.

Lượng token bao gồm không được công bốĐiều kiện tiền đềKhông nhà cung cấp lớn nào công bố gói thuê bao gồm bao nhiêu token. Họ chỉ đưa ra hệ số. Không thể lập ngân sách năm sau dựa trên một hạn mức không được công bố.
Cả hạn mức lẫn giá đều đã từng thay đổiLịch sử thay đổiViệc nâng hạn mức và giảm giá đều đã diễn ra nhiều lần. Việc chúng từng thay đổi nghĩa là chúng có thể tiếp tục thay đổi. Hướng đi do nhà cung cấp quyết định.
Phần vượt hạn mức quay lại giá niêm yếtChi phí biênGói thuê bao kéo giảm đơn giá trung bình, nhưng phần vượt hạn mức thì tính theo mức dùng. Giá của token tiếp theo không hề rẻ đi, dù bạn dùng nhiều đến đâu.

Thêm vào đó, các nhà cung cấp lớn đang chuẩn bị niêm yết, giai đoạn chịu áp lực chứng minh khả năng sinh lời. Giá sẽ đi theo hướng nào không do phía sử dụng quyết định.

Bạn không chọn được đơn giá. Bạn chọn được mức tiêu thụ.

Từ những điều trên, phương án còn lại cho doanh nghiệp là rõ ràng. Đơn giá do bên khác quyết định. Thứ duy nhất bạn kiểm soát được là lượng token tiêu thụ.Và nếu giảm được mức tiêu thụ, dù giá tăng hay giảm thì ảnh hưởng cũng nhỏ đi. Không cần đặt cược vào việc tăng giá, cũng không cần chờ giảm giá.

Ba cách thực tế để giảm mức tiêu thụ1. Đừng đọc lại cùng một tài liệu nhiều lần — lưu lại nội dung đã tìm hiểu dưới dạng bản tóm tắt, người hoặc AI tiếp theo chỉ đọc bản tóm tắt đó.2. Dùng máy chủ AI nội bộ — các xử lý lặp lại như sắp xếp, phân loại, tóm tắt có thể chạy trên mô hình đặt tại chỗ, không phát sinh phí theo mức dùng bên ngoài.3. Lưu đệm phần ngữ cảnh lặp lại — phần bạn gửi cùng một tiền đề mỗi lần sẽ rẻ đi đáng kể nhờ bộ đệm.

Chúng tôi đã biến ý tưởng này thành một hệ thống dùng thật trong nội bộ: AI của cả nhóm chia sẻ nội dung đã tìm hiểu dưới dạng bản tóm tắt, cắt giảm số token vốn dùng để đọc lại. Đó là SmartOptimizer. Việc sắp xếp bản tóm tắt được thực hiện trên máy chủ AI đặt trong nội bộ công ty, nên bản thân việc sắp xếp không phát sinh phí bên ngoài. Lượng token tiết kiệm được có thể xem theo tháng và theo dự án.

Không ai dám khẳng định chi phí AI sẽ đi theo hướng nào. Điều chắc chắn duy nhất là doanh nghiệp giảm được việc đọc lại sẽ có lợi dù giá đi hướng nào.

※ Số liệu trong bài là con số ước tính tính đến tháng 8 năm 2026, dựa trên công bố chính thức và báo chí. Giá và điều kiện có thể thay đổi. Vui lòng kiểm tra thông tin chính thức của từng nhà cung cấp.

Thẻ:

🌐 Tiếng Việt