Thông tin liên hệ
- 036.686.3943
- admin@nguoicodonvn2008.info
Claude Code là một công cụ cực kỳ hữu ích, nhưng chi phí sử dụng có thể tăng nhanh hơn nhiều người nghĩ. Nguyên nhân khá đơn giản: bạn không chỉ trả tiền cho prompt vừa nhập, mà còn “gánh” toàn bộ ngữ cảnh của phiên làm việc. Điều này bao gồm các tin nhắn trước đó, file đã đọc, output từ tool, các file memory như CLAUDE.md và nhiều chỉ dẫn nền khác.
Vì vậy, khi token bắt đầu tăng mạnh, vấn đề thường không nằm ở prompt kém, mà nằm ở việc ngữ cảnh bị “phình to” một cách không kiểm soát.
Nhiều lời khuyên phổ biến kiểu “giữ cuộc hội thoại ngắn” nghe thì đúng, nhưng lại không chỉ ra cụ thể điều gì thực sự tạo ra khác biệt. Điều quan trọng hơn là hiểu cách Claude Code xây dựng context, phần nào được gửi lại nhiều lần và những thói quen nào trong workflow đang âm thầm gây lãng phí.
Không phải task nào cũng cần model mạnh nhất. Đây là một trong những cách đơn giản nhưng bị bỏ qua nhiều nhất.
Trong hệ thống của Claude, các model có chi phí khác nhau đáng kể. Ví dụ, Opus có thể đắt gấp nhiều lần Sonnet tính theo token. Vì vậy, nếu dùng sai model cho những việc đơn giản, bạn sẽ lãng phí tài nguyên mà không cần thiết.
Một cách tiếp cận hợp lý là bắt đầu với Sonnet cho các công việc thường ngày như viết test, chỉnh sửa nhỏ hoặc giải thích code. Khi gặp các vấn đề phức tạp hơn như thiết kế hệ thống nhiều file hoặc debug lỗi liên quan nhiều thành phần, lúc đó mới chuyển sang Opus. Với những việc mang tính cơ học như đổi tên, format hay tra cứu nhanh, Haiku là lựa chọn tiết kiệm hơn.
/model sonnet # Day-to-day: writing tests, simple edits,
# explaining code, refactoring
/model opus # Complex: multi-file architecture decisions,
# debugging gnarly cross-system issues
/model haiku # Quick: lookups, formatting, renaming,
# anything repetitiveNgoài ra, bạn cũng có thể điều chỉnh mức độ “effort” để kiểm soát lượng suy luận mà model thực hiện. Với các task đơn giản, giảm effort sẽ giúp tiết kiệm token đáng kể.
Một trong những cách hiệu quả nhất để tiết kiệm token là tránh việc phải lặp lại các quy tắc dự án trong mỗi cuộc chat. Đó chính là vai trò của file CLAUDE.md.
File này được load ngay từ đầu và luôn tồn tại trong context của toàn bộ session. Điều này cũng đồng nghĩa: nếu CLAUDE.md dài 5.000 token, bạn sẽ phải “trả” 5.000 token cho mỗi lượt tương tác, dù bạn chỉ gửi một câu rất ngắn.
Vì vậy, CLAUDE.md nên chứa những thông tin ổn định như cách chạy test, package manager, quy tắc format, ràng buộc kiến trúc hoặc các thư mục không nên chỉnh sửa. Đồng thời, cần giữ file này càng gọn càng tốt.
Những nội dung như ghi chú họp, lịch sử thiết kế hay hướng dẫn dài dòng không nên đưa vào đây. Cách hiệu quả nhất là dùng CLAUDE.md như một bảng tra cứu nhanh, thay vì một “bộ não khổng lồ”.
Subagent là các instance Claude riêng biệt, hoạt động trong context độc lập. Khi chạy subagent, toàn bộ output dài như log, tìm kiếm file hay reasoning nhiều bước sẽ không làm “bẩn” context chính, mà chỉ trả về phần tóm tắt.
Điều này giúp giữ cho luồng làm việc chính gọn gàng hơn. Tuy nhiên, subagent không phải lúc nào cũng tiết kiệm.
Với các task nhỏ như chạy lệnh shell đơn giản hay thao tác git nhanh, việc dùng subagent đôi khi lại tốn thêm token do overhead từ kiến trúc, prompt và các lần gọi tool.
Vì vậy, nguyên tắc thực tế là chỉ dùng subagent khi phần context bạn “tránh được” lớn hơn chi phí khởi tạo của nó.
Một trong những cách lãng phí token nhanh nhất là yêu cầu Claude “xem toàn bộ repo” trong khi vấn đề thực tế chỉ nằm ở một vài file.
Khi yêu cầu quá mơ hồ, Claude sẽ phải mở nhiều file, thử nhiều hướng và tự xây dựng lại context — tất cả đều tiêu tốn token.
Cách tốt hơn là chỉ rõ file và thậm chí cả dòng code liên quan. Điều này giúp thu hẹp phạm vi xử lý và giảm đáng kể lượng token bị lãng phí.
Ngoài ra, bạn có thể sử dụng chế độ plan (Shift + Tab) để yêu cầu Claude đưa ra kế hoạch trước khi thực hiện. Nhờ đó, bạn có thể loại bỏ các bước không cần thiết trước khi chúng tiêu tốn tài nguyên.
Claude có thể tự động hoặc cho phép bạn chủ động nén (compact) session. Tuy nhiên, thời điểm sử dụng mới là yếu tố quan trọng.
Sau khi Claude đã đọc nhiều file, chạy lệnh và thử một vài hướng sai, session thường chứa rất nhiều thông tin không còn cần thiết. Đây chính là lúc nên dùng /compact để “làm sạch” context.
Nếu bạn đợi đến khi hệ thống báo đầy context hoặc bắt đầu “quên” thông tin, thì đã quá muộn. Lúc này, phần tóm tắt sẽ kém chính xác hơn.
Ngược lại, nếu compact sớm khi session còn “khỏe”, bạn sẽ giữ được thông tin quan trọng và loại bỏ phần dư thừa, giúp các bước sau nhẹ hơn đáng kể.
Một sai lầm phổ biến là tối ưu “mù”, trong khi không biết token đang bị tiêu tốn ở đâu.
Lệnh /context là công cụ giúp bạn nhìn rõ điều này. Nhiều khi phần tốn token nhất không nằm ở prompt hiện tại, mà là một file lớn đã được load trước đó, output từ tool, hoặc một memory file nặng.
Thay vì đoán, hãy kiểm tra thực tế. Chỉ cần loại bỏ một “thủ phạm thầm lặng” trong context cũng có thể mang lại cải thiện lớn.
Claude Code có thể kết nối với nhiều tool và nguồn dữ liệu khác nhau, nhưng càng nhiều tích hợp, context càng dễ trở nên nặng.
Nếu bạn thêm quá nhiều công cụ, model có thể phải “gánh” thêm nhiều overhead không cần thiết cho mỗi task.
Giải pháp là giữ hệ thống gọn gàng. Chỉ sử dụng những tích hợp thực sự giải quyết vấn đề lặp lại, thay vì bật mọi thứ chỉ vì “có thể”.
Cách hiệu quả nhất để giảm chi phí token không phải là kiểm soát từng prompt, mà là thiết kế lại workflow.
Khi bạn kiểm soát được context — biết cái gì nên giữ, cái gì nên bỏ, và cái gì không nên xuất hiện ngay từ đầu — bạn sẽ tiết kiệm được nhiều hơn bất kỳ mẹo nhỏ nào.
Nói cách khác, đừng chỉ nghĩ về prompt. Hãy nghĩ về cách toàn bộ context được xây dựng và vận hành.
Nguồn tin: Quantrimang.com
Ý kiến bạn đọc
Những tin mới hơn
Những tin cũ hơn
Những cách chạy LLM cục bộ thay thế Ollama hoặc llama.cpp
TOP công cụ AI tốt nhất dành cho người yêu thích du lịch
Prompt tạo video AI từ ý tưởng đến xuất bản
5 prompt Claude giúp lọc những đoạn quan trọng trong danh sách đọc Obsidian chất đống
Claude thử giải Giả thuyết Riemann - Chuyện gì đã xảy ra?
ChatGPT không tạo được ảnh: nguyên nhân và cách khắc phục
TOP nền tảng AI hỗ trợ cha mẹ nuôi dạy con cái
Cách tải dữ liệu Gemini Apps cá nhân về máy
Cách tạo hoạt động theo lịch trình trên Gemini
5 khóa học miễn phí giúp bạn học AI và LLM hiện đại
TOP nền tảng AI hỗ trợ cha mẹ nuôi dạy con cái
Cách quản lý dự án hiệu quả với AI
Cách kết nối với Fabric IQ từ một agent
TOP tính năng tạo video AI nổi bật nhất của Sora
5 prompt Claude biến nội dung nghiên cứu dạng plain-text thành thứ mà mọi người thực sự muốn đọc
Hướng dẫn tạo biểu mẫu sơ yếu lý lịch học sinh
Đừng phớt lờ các tài liệu hướng dẫn học tập của Gemini Notebook: Có thể bạn đã sử dụng chúng hoàn toàn sai cách!
Hướng dẫn toàn diện về các phương pháp sử dụng Grok hay nhất
Làm chủ AI Agent cho người mới: Cách xây dựng AI Agent thực sự hoạt động hiệu quả
Làm chủ AI Agent cho người mới: Cách xây dựng AI Agent thực sự hoạt động hiệu quả