ProductiveTechTalk - AI, Development Tools, and Productivity Blog

Claude Code: 15 cách giảm 80% chi phí token mà vẫn giữ chất lượng cao

Kim Jongwook · 2026-04-04

Claude Code là trợ lý AI cho lập trình giúp tự động hóa viết code, test và debug, nhưng nếu không để ý, chi phí token có thể tăng vọt lên vài trăm đô mỗi tháng mà bạn không hiểu vì sao. Bài viết này tổng hợp 15 kỹ thuật tối ưu token đã giúp một lập trình viên giảm chi phí Claude Code từ 300 USD xuống còn 60 USD/tháng — tiết kiệm 80% mà chất lượng làm việc không hề giảm, thậm chí còn tốt hơn.

Related: AutoResearch là gì? Biến AI thành hệ thống tự tối ưu

Related: Claude Code Auto Mode: Chạy tác vụ dài an toàn hơn

Related: Claude Code Auto Mode: Chạy Tác Vụ Dài Không Bị Hỏi

Related: Claude Code 2026: Nền tảng AI Operating System | Hướng Dẫn

TL;DR

  • Tách claude.md thành thư mục skills giúp giảm tối đa 94% token cho mỗi tin nhắn.
  • Dùng npx @anthropic/claude-code thay cho binary để sửa lỗi prompt cache, giảm chi phí tới 20 lần.
  • Kết hợp model routing (Opus cho plan, Sonnet cho execute) và effort low giúp giảm 60% chi phí tác vụ lặp.
  • Viết prompt siêu cụ thể với đường dẫn file, số dòng, biến… rẻ hơn prompt mơ hồ khoảng 10 lần.
  • Tắt MCP không dùng, bật Bare Mode và thêm .claudeignore để cắt “chi phí nền” trước cả khi AI bắt đầu làm việc.
Table of Contents

Mục lục

  • Claude Code đang đốt token vì điều gì?
  • Làm sao tối ưu cấu trúc context để giảm token nền? (Hack 1–3)
  • Tại sao model routing và effort control quyết định hóa đơn Claude Code? (Hack 4–5)
  • Làm thế nào để nén context, clear thông minh và sửa lỗi prompt cache? (Hack 6–8)
  • Vì sao Bare Mode, .claudeignore và dọn MCP giúp cắt “chi phí nền”? (Hack 9–11)
  • Hyper-specific prompt là gì và vì sao rẻ hơn 10 lần? (Hack 12)
  • Làm sao dựng “hàng rào an toàn” chống bùng chi phí? (Hack 13–15)
  • Nên bắt đầu từ đâu? Lộ trình hành động trong 30 ngày
  • Kết luận
  • Câu Hỏi Thường Gặp

Claude Code đang đốt token vì điều gì?

Claude Code là môi trường AI coding có cách tiêu thụ token mang tính “tích lũy theo phiên” — rất dễ bùng chi phí mà lập trình viên không nhận ra. Phần lớn chi phí không nằm ở thao tác thực sự (ví dụ sửa 1 dòng CSS) mà nằm ở context overhead: tất cả những gì Claude tự động gửi kèm mỗi lần bạn nhấn Enter.

Trong một trường hợp thực tế, chỉ khi hóa đơn chạm mức 300 USD/tháng, tác giả mới nhận ra mình đang “đốt token ở mọi tin nhắn”. Vấn đề lớn nhất: chỉ riêng file claude.md đã chiếm tới 42.000 token cho mỗi cuộc hội thoại, bất kể yêu cầu có nhỏ đến đâu.

Trên thực tế, khi bạn chưa đo được token per message thì gần như chắc chắn bạn đang trả nhiều hơn mức cần thiết.

Nguyên nhân không chỉ có một mà là tổng hợp của nhiều thứ cộng lại:

  • claude.md quá phình to, luôn được load toàn bộ
  • Lịch sử hội thoại bị gửi lại nguyên vẹn mỗi lần
  • Cấu trúc agent kém hiệu quả, mọi thao tác dồn vào một context
  • Lỗi prompt caching khiến mỗi request phải build lại context từ đầu
  • MCP server tự động nhét schema dài vào mọi message

Trong các phần sau, 15 hack sẽ lần lượt “bóc tách” từng nguồn lãng phí này.

Tôi nên hiểu gì trước khi tối ưu?

  • Claude luôn gửi lại toàn bộ context quan trọng ở mỗi request.
  • Bất kỳ thứ gì “tự động được load” đều là ứng viên gây lãng phí token.
  • Tối ưu là: giảm những thứ auto-loadphân tách bối cảnh theo từng nhiệm vụ.

Làm sao tối ưu cấu trúc context để giảm token nền? (Hack 1–3)

Tối ưu cấu trúc context là cách tổ chức lại những gì Claude tự động nạp vào mỗi yêu cầu để giảm “chi phí nền” cho mọi tin nhắn. Thay vì để một context khổng lồ đi theo mọi thao tác, ta chia nhỏ — chỉ nạp khi thực sự cần dùng.

Hack 1: Tách claude.md thành thư mục skills chuyên biệt

Hack đầu tiên là thu gọn claude.md và tách hướng dẫn chi tiết ra thành các “skill” riêng biệt. Trong nhiều dự án, claude.md phình lên tận 1.000 dòng (~42.000 token), và file này được đính kèm vào mọi cuộc hội thoại — kể cả khi bạn chỉ hỏi một câu đơn giản.

Cách tối ưu:

  • Tạo thư mục claude/skills.
  • Đưa các hướng dẫn chuyên biệt (cách viết test, style guide chi tiết, quy chuẩn CI/CD…) vào từng file skill riêng.
  • Giữ claude.md chính dưới 200 dòng, chỉ chứa:

  • Tóm tắt stack

  • Lệnh quan trọng
  • Quy tắc cốt lõi của đội

Khi đó, skill file chỉ được load khi bạn gọi rõ — token chỉ tiêu khi thật cần. Một trường hợp thực tế đã giảm từ 42.000 token xuống 2.400 token mỗi message, tương đương tiết kiệm 94%.

Nói ngắn gọn: tách claude.md sang skills là thay “phí thuê văn phòng hạng A cả tháng” bằng “thuê theo giờ khi có việc”.

Hack 2: Dùng Pre-tool Use Hook để lọc output test

Hack thứ hai nhắm vào output khổng lồ của lệnh shell, đặc biệt là test. Mặc định, Claude đưa toàn bộ output test vào context. Nếu bạn có 200 test đều pass, output đó có thể chiếm 8.000 token — hầu như vô nghĩa với việc debug.

Giải pháp là cấu hình Pre-tool Use Hook trong settings.json:

  • Chặn output của các lệnh test “xanh hết”.
  • Chỉ giữ lại log của các case failed để Claude phân tích.

Chỉ riêng bước này đã giúp mỗi lần chạy test tiết kiệm trên 60% token. Kiểu hook tương tự áp dụng với log build cũng cho kết quả tương đương, đặc biệt trong các dự án Node.js lớn.

Hack 3: Giao việc “ồn ào” cho Sub Agent để giữ sạch main context

Hack thứ ba là dùng Sub Agent có context riêng cho các nhiệm vụ đọc/duyệt nhiều file. Nếu bạn để main session đọc 15 file, kết quả là ~50.000 token bị “ghi nhớ vĩnh viễn” trong lịch sử hội thoại — và sẽ được gửi kèm theo mãi về sau.

Cách làm hiệu quả hơn:

  • Tạo một Sub Agent chỉ dùng cho việc dò codebase, đọc nhiều file, phân tích cấu trúc.
  • Để Sub Agent chạy trong cửa sổ context độc lập, rồi trả về tóm tắt ngắn cho main session.

Nếu dùng thêm model Haiku cho agent thăm dò này, chi phí còn rẻ hơn Sonnet khoảng 5 lần. Một kịch bản thực tế: tổng token cho phần khám phá giảm từ 80.000 xuống 20.000 token — tiết kiệm 75%.

Làm sao biết context đã tối ưu đủ chưa?

  • Đo token per message trước và sau khi tách claude.md.
  • Kiểm tra log: output test và log build có đang “tràn” vào context không.
  • Quan sát xem main session có còn chứa nhiều đoạn code “đã đọc từ 10 câu trước” không.

Tại sao model routing và effort control quyết định hóa đơn Claude Code? (Hack 4–5)

Model routing là chiến lược phân bổ mô hình AI phù hợp ở từng giai đoạn công việc để cân bằng chi phí và chất lượng. Kết quả thử nghiệm cho thấy khoảng 20% token dùng cho lập kế hoạch (planning), còn 80% bị đốt ở thực thi (execution). Đây là chỗ model routing phát huy tác dụng rõ nhất.

Hack 4: Dùng Opus để “nghĩ”, Sonnet để “làm”

Ý tưởng của model routing rất đơn giản:

  • Planning: dùng model mạnh nhất (Opus) để vạch ra kiến trúc, chiến lược, kế hoạch.
  • Execution: dùng model rẻ hơn (Sonnet) để sinh code, refactor, chạy tác vụ lặp.

Claude Code hỗ trợ cấu hình kiểu “Opus Plan“:

  • Tự động chọn Opus khi bước vào chế độ kế hoạch.
  • Chuyển sang Sonnet khi bắt đầu triển khai code theo plan.

Những quyết định kiến trúc sai thường khiến bạn phải “đốt lại” rất nhiều token debug về sau. Để Opus xử lý phần suy nghĩ sâu, rồi để Sonnet lo phần tay chân là cấu hình hợp lý nhất về chi phí/giá trị.

Hack 5: Dùng Effort Control để kiểm soát “thinking token”

Effort control là cơ chế điều chỉnh mức độ suy nghĩ của mô hình cho từng tác vụ. /effort low giúp mô hình dùng ít “thinking token” hơn; /effort high làm điều ngược lại.

  • Với các công việc đơn giản (format, lint, sửa text): dùng /effort low.
  • Với các bài toán phức tạp (debug rối, thiết kế kiến trúc): dùng /effort high.

Low effort dùng ít hơn tới 10 lần thinking token so với max effort. Đặt mặc định là low có thể giúp giảm 60% chi phí tác vụ thường ngày mà không giảm chất lượng với những việc vốn đã đơn giản.

Một lập trình viên có kinh nghiệm sẽ “đốt sức mạnh model” đúng nơi, đúng thời điểm — thay vì để mọi tác vụ đều chạy ở chế độ “full turbo”.

Kết hợp model routing và effort control thế nào?

  • Planning: Opus + effort high cho những quyết định quan trọng.
  • Execution: Sonnet + effort low cho toàn bộ bước implement theo plan.
  • Chỉ bật effort medium/high khi thực sự kẹt về logic hoặc thiết kế.

Làm thế nào để nén context, clear thông minh và sửa lỗi prompt cache? (Hack 6–8)

Nén context là cách giảm kích thước mỗi request khi phiên làm việc kéo dài. Bạn chat càng lâu, Claude càng phải gửi kèm nhiều thông tin — chi phí phình ra mà bạn không cảm nhận được tức thì.

Hack 6: Tuning Autocompact để nén sớm hơn

Autocompact là cơ chế tự động tóm tắt và nén lại context khi gần đầy dung lượng. Mặc định, Claude chỉ bắt đầu autocompact khi context đạt 83% sức chứa.

Vấn đề: đến lúc chạm 83%, bạn đã có hàng chục tin nhắn trước đó gửi nguyên payload khổng lồ đi rồi.

Cách tối ưu: trong settings.json, đặt claude_autocompact_pct_override = 70. Quá trình nén bắt đầu sớm hơn, mọi tin nhắn về sau đều nhẹ hơn rõ rệt. Thử nghiệm trên một repo monorepo lớn, chỉ sau vài buổi làm việc, tổng token per day giảm đáng kể mà trải nghiệm không thay đổi nhiều.

Hack 7: Dùng /clear/compact như “dao mổ” cho context

Claude gửi lại toàn bộ 9 tin nhắn trước khi bạn gửi tin nhắn thứ 10. Nếu bạn đang làm nhiều task không liên quan trong một session, lượng context dư thừa gửi kèm là cực lớn.

Hai lệnh cần dùng chiến lược:

  • /clear: dùng khi chuyển sang công việc hoàn toàn khác.
  • /compact focus on authentication: nén và chỉ giữ lại phần liên quan đến auth, bỏ bớt các nhánh nội dung khác.

Dùng đúng cách, bạn giữ được lịch sử hữu ích cho 1 chủ đề trong khi xóa toàn bộ “nhiễu” từ các nhiệm vụ cũ — vừa tiết kiệm token vừa tránh Claude bị lẫn bối cảnh.

Hack 8: Sửa lỗi prompt caching bằng cách bỏ hẳn binary

Đây là một trong những cú “ăn tiền” nhất nhưng ít ai biết.

Bản standalone binary của Claude Code có bug khiến prompt cache không hoạt động đúng. Hậu quả: mỗi request đều phải build lại toàn bộ context từ đầu, khiến chi phí tăng 10–20 lần so với khi cache chạy đúng.

Giải pháp cực đơn giản — tạo alias:

alias claude="npx @anthropic/claude-code"

Chỉ riêng thay đổi này đã giảm chi phí mỗi request xuống một phần nhỏ so với trước vì cache bắt đầu làm việc chính xác.

Nếu bạn chỉ chọn 1 hack để làm ngay hôm nay, chuyển sang npx @anthropic/claude-code xứng đáng đứng đầu danh sách.

Còn gì nữa ngoài cache?

Kiểm tra và tắt MCP connector không dùng: nhiều MCP vẫn bơm schema vào context dù bạn chẳng bao giờ gọi. Đặc biệt chú ý các MCP “nặng” như Linear — chúng có thể chiếm tới 7% context (14.000 token) mà không mang lại giá trị nếu hiếm khi sử dụng.


Vì sao Bare Mode, .claudeignore và dọn MCP giúp cắt “chi phí nền”? (Hack 9–11)

Bare Mode, .claudeignore và audit MCP đều nhắm vào một vấn đề: chi phí bị tiêu trước khi Claude làm bất kỳ việc hữu ích nào. Đây là “chi phí nền” gồm hook, plugin, schema, file rác…

Hack 9: Bare Mode cho CI/CD và script lặp

Bare Mode là chế độ chạy Claude Code tối giản mọi overhead, chỉ giữ phần logic lõi để thực thi task. Trong session tương tác bình thường, Claude sẽ nạp hook, skill, plugin, MCP server, claude.md và AutoMemory. Mỗi thứ đó đều ngốn token khi gửi request.

Khi dùng:

claude --bare -p "mô tả tác vụ"

Bạn có môi trường không hook, không skill, không MCP, không AutoMemory — hoàn toàn quyết định luận, phù hợp cho CI/CD và script tự động.

Một ví dụ cụ thể: lệnh commit tốn 15.000 token trong interactive session, nhưng chỉ 3.000 token trong Bare Mode — tiết kiệm 80%.

Hack 10: Dùng .claudeignore để chặn file “rác”

.claudeignore hoạt động giống .gitignore nhưng dành cho Claude. Tạo file này ở root project và chỉ định:

  • node_modules/
  • build/ hoặc dist/
  • File lock (package-lock.json có thể dài tới 12.000 dòng)
  • Các file sinh tự động, nhị phân, log lớn…

Nếu không ignore, mỗi lần Claude khám phá codebase, nó có thể phải “đọc” những file đó — tốn hàng nghìn token cho thứ không giúp ích gì khi hiểu logic ứng dụng. Với các dự án React, chỉ việc ignore build artifact và lockfile đã giảm thấy rõ chi phí khi lần đầu cho Claude “làm quen” với repo.

Hack 11: Audit MCP server và ưu tiên CLI tools

Mỗi MCP server khi bật sẽ bơm tool schema vào context mỗi message — dù bạn không gọi tool, schema vẫn chiếm chỗ. Một ví dụ thực tế: chỉ một MCP Linear đã chiếm 14.000 token, tương đương 7% context window, ở mọi request.

Nguyên tắc đơn giản:

  • MCP nào không dùng thường xuyên → tắt.
  • Ưu tiên CLI tool cho các tác vụ có thể script được, vì CLI không thêm overhead vào context.

Không nên “cõng cả nhà kho tool” theo mỗi lần Claude chỉ cần sửa 1 hàm nhỏ.


Hyper-specific prompt là gì và vì sao rẻ hơn 10 lần? (Hack 12)

Hyper-specific prompt là cách viết prompt đủ chi tiết để Claude không cần tự đi khám phá codebase trước khi hành động. Điểm mấu chốt ở đây là: sự cụ thể của prompt liên quan trực tiếp đến số token dùng cho bước “đi tìm bối cảnh”.

Ví dụ prompt mơ hồ:

“Sửa giúp mình bug trong phần đăng nhập.”

Với yêu cầu như vậy, Claude phải grep và mở 10–15 file liên quan auth, route, service… Mỗi file đọc tốn 1.000–5.000 token — chi phí khám phá cực lớn trước khi làm được bất cứ điều gì.

Prompt hyper-specific:

“Trong file src/validate.ts, dòng 42, sửa logic kiểm tra hết hạn JWT. Hiện đang dùng Date.now() nhưng token lưu thời gian theo Unix seconds, cần chuyển sang so sánh theo giây.”

Hoặc ngắn hơn:

“Trong @src/auth/validate.ts, tại hàm validateJwt, chỉnh lại phần expiry so sánh với timestamp theo giây thay vì mili-giây.”

Với dạng prompt này, Claude chỉ cần mở 1 file đúng chỗ, hiểu ngay ngữ cảnh và sửa. Không cần crawl 10–15 file — token giảm tới 10 lần.

Đầu tư thêm 30 giây để tra đường dẫn file, số dòng và mô tả rõ bối cảnh có thể tiết kiệm hàng nghìn token mỗi ngày.

Làm sao hình thành thói quen hyper-specific?

  • Luôn copy đường dẫn file và số dòng từ editor/IDE.
  • Nêu rõ tên hàm, biến, logic hiện tại, và bạn muốn thay đổi thành gì.
  • Tránh prompt kiểu “chịu khó đọc code rồi tự sửa giúp em”.

Làm sao dựng “hàng rào an toàn” chống bùng chi phí? (Hack 13–15)

Các hack cuối nhắm vào việc ngăn chi phí bùng nổ khi agent chạy vòng lặp tự động, khi thiếu code intelligence, hoặc khi bước lập kế hoạch không đủ rõ ràng.

Hack 13: Giới hạn số vòng agent và ngân sách bằng flag

Runaway spending safety net là cơ chế đặt giới hạn cứng cho số vòng agent và ngân sách chi tiêu.

Một case thực tế: một prompt mơ hồ kích hoạt 47 vòng agent liên tiếp, đốt 8 USD chỉ trong một session.

Để tránh lặp lại:

  • Dùng --max-turns 10 để giới hạn tối đa 10 vòng.
  • Dùng --max-budget-usd để cài trần chi phí cho 1 lần chạy.

Về bản chất, đây là “cầu dao chống cháy” cho ví tiền của bạn.

Hack 14: Cài Code Intelligence Plugin để tránh grep tốn kém

Nếu không có code intelligence (language server, symbol index…), Claude phải grep tìm định nghĩa hàm, mở thêm nhiều file, rồi phân tích nội dung thô.

Một bài test cho thấy sự chênh lệch rõ:

  • Không có plugin: tìm hàm cần sửa → 8.500 token
  • Có language server: cùng tác vụ → chỉ 200 token, giảm khoảng 42 lần

Với dự án lớn, cài plugin code intelligence là bắt buộc nếu bạn không muốn Claude phải liên tục “đọc mò” code giống như lập trình viên mới vào team.

Hack 15: Dùng Plan Mode để giảm tiêu hao token ở bước implement

Plan Mode là chế độ Claude tập trung lập kế hoạch chi tiết trước khi viết code. Token cho planning rẻ hơn rất nhiều so với token cho implementation.

Boris Churnney (người tạo Claude Quotes) đã nhận xét đại ý:

30 phút dành cho việc lập kế hoạch thường có thể rút một build 10 giờ xuống còn 3 giờ.

Trong ngữ cảnh token: 80% token thường bị đốt ở giai đoạn implementation — bao gồm cả branch sai hướng, refactor lại, thử sai. Nếu dành 80% “nỗ lực trí tuệ” vào Plan Mode trước, bạn chốt kiến trúc sớm hơn và tránh được những vòng thử sai tốn kém.

Khi thử so sánh trực tiếp, những phiên sử dụng Claude bắt đầu bằng “hãy lập kế hoạch chi tiết” gần như luôn rẻ hơn và cho kết quả sạch hơn so với những phiên nhảy ngay vào “hãy viết code”.


Nên bắt đầu từ đâu? Lộ trình hành động trong 30 ngày

Lộ trình 30 ngày giúp bạn không bị “ngợp” với 15 hack mà vẫn đạt hiệu quả rõ rệt.

Tuần 1: Cắt các lãng phí lớn nhất

  • Chuyển sang dùng npx @anthropic/claude-code (sửa lỗi prompt cache).
  • Thu gọn claude.md dưới 200 dòng, tạo thư mục claude/skills.
  • Tạo .claudeignore để chặn node_modules, build artifact, lockfile.
  • Tắt mọi MCP server không dùng thường xuyên.

Tuần 2: Tối ưu cấu trúc context và nén

  • Cấu hình Pre-tool Use Hook để lọc output test, chỉ giữ lỗi.
  • Tạo Sub Agent cho việc khám phá codebase, dùng model Haiku nếu có.
  • Đặt claude_autocompact_pct_override = 70.
  • Tập thói quen dùng /clear khi chuyển task và /compact focus on ....

Tuần 3: Tinh chỉnh model routing và effort

  • Cấu hình “Opus Plan + Sonnet Execute” cho workflow chính.
  • Đặt effort mặc định là /effort low cho task thường ngày.
  • Chỉ bật /effort high cho debug khó hoặc quyết định kiến trúc.
  • Cấu hình Bare Mode cho các bước trong CI/CD pipeline.

Tuần 4: Chuẩn hóa thói quen và hàng rào an toàn

  • Tập viết hyper-specific prompt với đường dẫn file, số dòng, tên hàm.
  • Cài đặt Code Intelligence Plugin/language server cho repo chính.
  • Đặt --max-turns--max-budget-usd mặc định cho mọi agent.
  • Chia sẻ nội bộ trong team, đưa các hack thành tiêu chuẩn làm việc chung.

Kết luận

15 kỹ thuật này đã chứng minh rằng Claude Code hoàn toàn có thể vận hành với chi phí bằng 1/5 mà vẫn giữ hiệu suất cao — cụ thể là giảm từ 300 USD xuống 60 USD/tháng. Không chỉ hóa đơn giảm, tốc độ phản hồi còn nhanh hơn và context sạch hơn, ít nhiễu hơn.

Nhưng có một điều đáng chú ý hơn cả con số: tối ưu token thực chất là tối ưu thói quen dùng AI. Biết lúc nào cần nhiều sức mạnh suy nghĩ, lúc nào chỉ cần thao tác đơn giản; bớt để AI “tự bơi mù” trong codebase mà cung cấp đúng bối cảnh cần thiết. Những nguyên tắc này không chỉ áp dụng cho Claude Code — chúng hữu ích với bất kỳ AI coding assistant nào khác.


Bạn nên bắt đầu như thế nào từ hôm nay?

  • Kiểm tra lại hóa đơn, đo thử token per message trong vài phiên làm việc điển hình.
  • Thu gọn claude.md, tạo thư mục claude/skills và thêm .claudeignore.
  • Chuyển sang npx @anthropic/claude-code và tắt MCP không sử dụng.
  • Tập viết 3–5 prompt hyper-specific cho các bug đang tồn tại trong dự án.
  • Thiết lập Bare Mode cho CI và đặt --max-turns, --max-budget-usd cho mọi agent.

Câu Hỏi Thường Gặp

Q: Vì sao claude.md lại tốn nhiều token đến vậy?

A: claude.md được gửi kèm theo mọi request như một phần context nền. Khi file này phình lên đến hàng nghìn dòng, mỗi tin nhắn sẽ phải “cõng” theo hàng chục nghìn token không đổi — dù yêu cầu chỉ là sửa một chi tiết nhỏ. Thu gọn file này và tách sang skills giúp chỉ nạp hướng dẫn chi tiết khi thật sự cần.

Q: Tại sao phải dùng npx @anthropic/claude-code thay vì binary?

A: Bản binary độc lập của Claude Code có lỗi khiến prompt caching không hoạt động đúng, buộc mỗi request phải rebuild context từ đầu. Khi dùng npx @anthropic/claude-code, cache hoạt động bình thường, giúp giảm chi phí mỗi request xuống còn khoảng 1/10–1/20 so với trước. Đây là một trong những cách tiết kiệm mạnh nhất và dễ triển khai nhất.

Q: Hyper-specific prompt khác gì so với việc cho Claude tự đọc code?

A: Với prompt mơ hồ, Claude cần tự tìm file liên quan bằng cách grep và mở nhiều file — tiêu tốn rất nhiều token chỉ để hiểu bối cảnh. Hyper-specific prompt cung cấp sẵn đường dẫn file, số dòng, hàm, biến… nên Claude chỉ cần đọc đúng vị trí đó để làm việc. Thường rẻ hơn khoảng 10 lần.

Q: Khi nào nên dùng Bare Mode và khi nào nên dùng session tương tác đầy đủ?

A: Bare Mode phù hợp với các tác vụ lặp, script hóa như commit, format, chạy check trong CI/CD — nơi bạn không cần hook, skill, MCP hay bộ nhớ. Session tương tác đầy đủ phù hợp khi bạn cần trao đổi dài, tận dụng MCP và plugin để Claude hiểu dự án sâu hơn. Kết hợp cả hai giúp cân bằng trải nghiệm và chi phí.

Q: Các kỹ thuật tối ưu token này có áp dụng được cho công cụ AI khác ngoài Claude Code không?

A: Có. Phần lớn nguyên tắc xoay quanh quản lý context: giảm overhead, tách kiến thức nền, nén lịch sử, dùng model rẻ cho việc lặp, dùng prompt cụ thể. Dù API và tên tính năng có khác, chiến lược như ignore file rác, giới hạn vòng lặp agent hay dùng plan mode vẫn có thể chuyển hóa sang GitHub Copilot Chat, Codeium hay các agent tự triển khai.

Tài liệu tham khảo thêm:

Bài viết này có hữu ích không?

Nhận thêm những bài viết công nghệ miễn phí.

Theo dõi blog qua email

Nhập địa chỉ email của bạn để đăng ký theo dõi blog này và nhận thông báo về các bài mới qua email.


Khám phá thêm từ ProductiveTechTalk

Đăng ký để nhận các bài đăng mới nhất được gửi đến email của bạn.

Một phản hồi cho “Claude Code: 15 cách giảm 80% chi phí token hiệu quả”

  1. Ảnh đại diện ProductiveTechTalk

    The bit about hyper-specific prompts being up to 10x cheaper than vague ones really resonated with me. I’ve noticed the same thing anecdotally — when I paste a whole file and say “find the bug”, the model rambles, but when I point to a function and line range, it nails it quickly. Framing that as a *cost* issue, not just a quality issue, is a mindset shift I wish more devs had.

    Source: https://www.youtube.com/watch?v=UZc7h8UqrqU

Gửi phản hồi

Khám phá thêm từ ProductiveTechTalk

Đăng ký ngay để tiếp tục đọc và truy cập kho lưu trữ đầy đủ.

Tiếp tục đọc