Tình huống triển khai AI
"Muốn dùng ChatGPT cho công việc. Nhưng không thể gửi dữ liệu khách hàng hay mã nguồn của mình lên dịch vụ AI bên ngoài" — đây là nỗi trăn trở nghe thấy ở nhiều doanh nghiệp. Lần này là ghi chép thực tế về việc biến mộtchiếc PC cũ từng dùng để đào tiền mã hóa ngủ quên trong khothành một "ChatGPT riêng cho nội bộ" mà toàn thể nhân viên đều có thể dùng. Chi phí đầu tư phần cứng bổ sung gần như bằng không. Công việc xây dựng do AI agent (Claude) chủ đạo, và mất2 ngày làm việc thực tế.
Nguyên liệu là "4 chiếc GPU cũ lỗi thời".
Chúng tôi dùng chiếc PC đã hết vai trò từ cơn sốt đào coin vài năm trước. GPU trang bị là 4 chiếc AMD Radeon Vega 56/64 — không phải GPU dành cho AI mới nhất, thậm chí cũng không phải hàng NVIDIA. Đây là nguyên liệu lệch khỏi lẽ thường về "máy chủ AI" của thiên hạ.
Tuy nhiên tổng bộ nhớ video của 4 chiếc là 32GB. Chú ý đến điểm này, AI agent đã thiết kế một cấu hình dùng API đồ họa và tính toán mở "Vulkan" để vượt qua ràng buộc không dùng được phương thức chuẩn cho AI (CUDA).sánh ngang với GPT-4o năm 2024Chúng tôi đã thành công vận hành đồng thời 3 mô hình AI theo từng mục đích, bao gồm cả một mô hình mở (tầm 30 tỷ tham số) được cho là như vậy.
- Dùng cho chat hằng ngày (7B): 43 token mỗi giây — tốc độ cảm nhận tương đương ChatGPT
- Dùng cho sinh mã nâng cao và tư vấn thiết kế (tầm 30B): 30 token mỗi giây — mức thông minh ngang GPT-4o (2024)
- Dùng cho gợi ý mã trong trình soạn thảo (1.5B): 127 token mỗi giây — gợi ý nhập liệu như GitHub Copilot
Giao diện là Web UI giống hệt ChatGPT. Nhân viên chỉ cần mở trình duyệt là có thể sử dụng, chuyển đổi qua lại giữa các mô hình. Kỹ sư cũng đã tích hợp tính năng tự động gợi ý kiểu Copilot vào VS Code.Toàn bộ xử lý gói gọn trong nội bộ, không một byte dữ liệu nào ra ngoài.
Vai chính trong việc xây dựng là AI agent. Con người chỉ chuyên tâm vào việc phán định.
Việc xây dựng lần này chính là hiện thân của "phát triển dựa trên AI" mà chúng tôi thực hành. Cài đặt OS, build engine suy luận, thiết kế phân tách mạng, điều tra sự cố — người ra tay chính là AI agent. Con người chỉ đảm nhận việc ra quyết định ở các điểm mấu chốt và các thao tác vật lý (như cắm lại cáp).
Điều đáng nói là cách xử lý sự cố. Trong quá trình xây dựng, một trong các GPU cũ trục trặc và liên tục mất kết nối. AI agent đã xác định vị trí hỏng từ kernel log, chỉ ra "card ở khe cắm vật lý nào" bằng cách quay quạt để hướng dẫn thay thế. Hơn nữa, còn cài cảmột thiết kế mà mạng không bị đứt dù GPU có hỏng về sau(cố định địa chỉ MAC), vàcơ chế giám sát phát hiện bất thường mỗi 5 phút và tự động phục hồi. Nay chiếc server này ở trạng thái "có thể để mặc" — chỉ cần bật nguồn là toàn bộ dịch vụ tự động khởi động.
Bảo mật dựa trên "giả định bị xâm nhập".
Chúng tôi cũng công khai lên Internet để có thể dùng từ bên ngoài công ty, nhưng thiết kế dựa trên tiền đề "dù lỡ bị xâm nhập cũng không để thiệt hại lan rộng". Server được cách ly trong một mạng riêng (DMZ), với cấu hình hoàn toàn không thể chạm tới các hệ thống nội bộ khác. Tài khoản theo chế độ quản trị viên phê duyệt, mọi liên lạc đều được mã hóa.một server mà với kẻ tấn công thì "có vào cũng chẳng có gì".
Chi phí bỏ ra và những gì thu được.
- Đầu tư phần cứng bổ sung:gần như bằng không(tái sử dụng chiếc PC đào coin nhàn rỗi sẵn có)
- Thời gian xây dựng:2 ngày làm việc thực tế(bao gồm cả xử lý sự cố và thiết kế bảo mật)
- Chi phí vận hành: chỉ tiền điện (đã tiết kiệm điện nhờ giới hạn công suất GPU).Phí sử dụng API là 0 yên cố định, không giới hạn
- Những gì thu được: một AI chat riêng cho nội bộ mà toàn thể nhân viên dùng được + nền tảng gợi ý mã dành cho lập trình viên
Không cần GPU mới nhất, không cần NVIDIA, tùy cách làm mà vẫn có thể dựng được "nền tảng AI nội bộ ở mức thực dụng". Đúng hơn, bản chất là trước một phần cứng đầy ràng buộc,nhanh chóng tìm ra cấu hình đúng và xây dựng cả cơ chế đứng dậy được sau khi vấp ngã— và đó là công việc mà AI agent giỏi nhất.
"Chiếc máy nhàn rỗi của công ty tôi" cũng có thể trở thành nền tảng AI.
"Đã từ bỏ ứng dụng AI vì không thể đưa dữ liệu ra ngoài", "không dự đoán được chi phí API của AI đám mây", "có server hay PC gaming đang dư" — nếu đúng dù chỉ một điều, thì nền tảng AI nội bộ ở gần hơn bạn nghĩ.
Chúng tôi hỗ trợ xây dựng "nền tảng AI riêng cho nội bộ" tận dụng phần cứng nhàn rỗi sẵn có của bạn.
Việc chẩn đoán mức phù hợp của thiết bị hiện có là miễn phí. Cùng với việc đổi mới hệ thống cũ (AI Re: Platform / viết tắt: AIR Platform),Hãy liên hệ với chúng tôi ngay hôm nay.
Biểu mẫu liên hệ(vui lòng ghi kèm "Mong muốn trao đổi về nền tảng AI nội bộ") / info@flagship-ai.jp
Loạt bài "Legacy to AI — Ghi chép thực tế"
- Tổng hợp: 22 hệ thống và 246 nghìn dòng code trên một chiếc PC — ghi chép đo lường thực tế về 3,5 tháng phát triển với AI
- Ghi chép thực tế ①: Đổi mới toàn diện một hệ thống Java 20 năm tuổi trong khoảng 1 tuần
- Ghi chép thực tế ②: Tạo lối vào mới cho hệ thống lõi mà không thay đổi 0 dòng mã hiện có
- Ghi chép thực tế ③: Hoàn tất việc khảo sát kiến trúc vốn mất cả tháng bằng prototype 2 ngày + đo lường thực tế
- Ghi chép thực tế ④: Chiếc PC đào coin cũ trở thành "ChatGPT riêng cho nội bộ" trong 2 ngày (bài viết này)
* Các con số trong bài viết này là giá trị đo lường thực tế tại thời điểm tháng 8 năm 2026. Thành quả xây dựng sẽ khác nhau tùy theo tình trạng và yêu cầu của phần cứng.