Faster feedback
Tool và local model có thể xử lý nhiều vòng nhỏ mà không phải chờ mạng hay truyền context lớn.
Một model mạnh có thể làm gần như mọi thứ, nhưng điều đó không có nghĩa nó nên làm mọi thứ. ChatCode hướng tới một router biết khi nào chỉ cần công cụ xác định, khi nào local AI là đủ và khi nào phải gọi đến cloud hoặc frontier model.
Nhiều tác vụ trong phát triển phần mềm đã có lời giải deterministic rất tốt. Git biết chính xác file nào thay đổi. Test runner biết test nào fail. Parser hiểu cú pháp. LSP biết symbol. Formatter biết cách định dạng. Những công việc như vậy không cần một model lớn “đoán” lại điều máy tính đã biết chắc.
Đó là tầng đầu tiên của Responsible AI Routing: never spend intelligence where computation is enough.
Local AI phù hợp cho những việc cần hiểu ngôn ngữ hoặc pattern nhưng chưa nhất thiết cần reasoning cực mạnh: tóm tắt log, gom nhóm lỗi, chuẩn bị context, draft đơn giản, phân loại thay đổi, tạo candidate patch hoặc hỗ trợ tìm vùng source có khả năng liên quan.
Điểm quan trọng không phải “local bằng mọi giá”. Một model local yếu không nên giữ một tác vụ mà nó không đủ khả năng giải quyết. Router phải biết escalate.
Search, Git, parser, test, formatter, static analysis.
Summarize, classify, filter, compress context.
Draft, refactor nhỏ, candidate fix và verification sơ bộ.
Reasoning phức tạp, context dài, nhiều bước và nhiều trade-off.
Bài toán mới, mơ hồ, khó hoặc có giá trị cao cần năng lực tốt nhất.
ChatCode không nên trì hoãn gọi model mạnh chỉ để làm đẹp một chỉ số “AI saved”. Nếu gửi lên cloud ngay giúp kết quả nhanh hơn, chính xác hơn hoặc an toàn hơn thì đó là lựa chọn đúng. Thước đo cần tối ưu là chi phí tài nguyên trên một kết quả hữu ích đã được kiểm chứng, không phải số request thấp nhất.
Tool và local model có thể xử lý nhiều vòng nhỏ mà không phải chờ mạng hay truyền context lớn.
Dữ liệu không cần rời thiết bị thì không nên rời thiết bị, miễn local path đáp ứng đúng yêu cầu công việc.
Frontier model nhận context đã lọc, bằng chứng test và dependency rõ ràng thay vì một kho source hỗn loạn.
Khi confidence thấp, test thất bại hoặc vấn đề vượt khả năng local, router chuyển lên tầng mạnh hơn thay vì cố chấp.
Trải nghiệm tốt nhất là người dùng chỉ nói điều họ muốn đạt được. ChatCode phân tích công việc, trạng thái project, độ nhạy dữ liệu, tài nguyên máy và yêu cầu chất lượng rồi chọn đường xử lý phù hợp. Người dùng vẫn có quyền đặt policy: ưu tiên chất lượng, cân bằng, tiết kiệm cloud hoặc local-only.
The right intelligence, at the right place, for the right task.