ProductiveTechTalk - AI, Development Tools, and Productivity Blog
Flat illustration of advisor and executor AI models collaborating to cut costs

Đọc bài này trước khi build thêm bất kỳ app AI nào với Claude Advisor

Kim Jongwook · 2026-04-10

TL;DR

Diagram-style illustration of advisor and executor AI roles
  • Claude Advisor Tool là cơ chế “Opus làm cố vấn, Sonnet/Haiku làm người thi công” trong cùng một AI pipeline.
  • Kết quả SWE-bench: Sonnet+Opus Advisor chính xác hơn Sonnet đơn lẻ nhưng tổng chi phí vẫn giảm.
  • Demo du lịch Nhật: Sonnet+Opus Advisor cho lộ trình ngắn nhất với chi phí chỉ khoảng 1/5 so với Opus đơn lẻ.
  • Advisor Tool càng giúp tăng chất lượng rõ khi kết hợp với model rẻ (Haiku), tối ưu cho dự án ngân sách thấp.
  • Cần lưu ý giới hạn max_uses, pause streaming khi Advisor chạy và luôn tự benchmark trước khi đưa vào sản phẩm.
Table of Contents


Claude Advisor Tool là cơ chế cộng tác đa mô hình mới của Anthropic, tách rõ vai trò “cố vấn thông minh” và “người thực thi giá rẻ” trong cùng một pipeline AI. Thay vì tự viết hệ thống điều phối phức tạp, giờ chỉ với một định nghĩa Tool, Sonnet hoặc Haiku có thể chủ động gọi Opus khi cần tư vấn cho những đoạn suy luận khó.

Related: Open Claude là gì? Bí mật AI agent vận hành 500 người

Related: Claude Code 2026: Nền tảng AI Operating System | Hướng Dẫn

Related: Claude Code: 10 bí quyết tăng năng suất gấp 10 lần

Related: AI website na ná nhau: nguyên nhân & cách sửa | Hướng dẫn

Related: Claude Code: 15 cách giảm 80% chi phí token hiệu quả

Tôi đã thử mô hình “một model rẻ chạy chính, một model mạnh chỉ được gọi khi thật sự cần” trong vài project nội bộ và luôn thấy hiệu quả chi phí rất rõ. Claude Advisor Tool về bản chất là Anthropic đóng gói và chuẩn hóa chính chiến lược đó — thêm lớp quản lý token, max_uses và báo cáo cost minh bạch.

Bài này đi thẳng vào: Claude Advisor Tool là gì, vì sao benchmark SWE-bench và demo du lịch lại đáng để xem, cách triển khai qua API, những giới hạn kỹ thuật cần biết, và checklist thực tế để bạn tích hợp vào hệ thống hiện tại mà không “đốt tiền”.

Mục lục

Illustration of SWE-bench accuracy vs cost with advisor setup

Claude Advisor Tool là gì và khác gì việc gọi một model mạnh thông thường?

Tokyo map with multiple AI-planned travel routes showing advisor gains

Claude Advisor Tool là một cơ chế cộng tác đa mô hình (multi-model collaboration) giúp tách vai trò “cố vấn” và “người thực thi” trong cùng một pipeline AI. Trong cơ chế này, Claude Opus luôn đóng vai Advisor (cố vấn), còn Executor (người thực thi) có thể là Claude Sonnet hoặc Claude Haiku tùy bài toán và ngân sách.

Luồng hoạt động khá rõ: Executor là model chạy chính, nhận yêu cầu từ người dùng, sinh reasoning và kết quả. Khi gặp đoạn suy luận quá phức tạp, nó gọi một Tool đặc biệt — chính là Opus — để xin lời khuyên, nhận câu trả lời, rồi đưa vào context của mình và tiếp tục.

Với lập trình viên đã quen làm việc với Claude, pattern này rất quen thuộc. Nhiều người vốn đã dùng Opus để thiết kế giải pháp hoặc lên plan, sau đó dùng Sonnet/Haiku để triển khai cho rẻ. Giờ thay vì viết logic orchestration bên ngoài, bạn nhúng “chuyên gia Opus” trực tiếp vào tools array và để Executor tự quyết định khi nào cần hỏi.

Nói ngắn gọn: Advisor Tool tự động hóa thói quen “hỏi ông anh senior rồi tự code” mà rất nhiều dev vẫn làm hằng ngày.

Cách phối hợp vai trò Advisor – Executor diễn ra như thế nào?

  1. Executor nhận yêu cầu — đọc prompt người dùng, bối cảnh, history rồi bắt đầu suy luận như bình thường.

  2. Tự đánh giá độ khó — khi gặp đoạn cần quyết định phức tạp (kiến trúc hệ thống, chiến lược marketing, refactor code lớn), nó quyết định gọi Advisor Tool.

  3. Gọi Opus như một Tool — Opus nhận input chuyên biệt, phân tích sâu, trả về gợi ý hoặc blueprint.

  4. Executor hợp nhất và trả lời — Sonnet/Haiku đọc kết quả của Opus, trộn với context hiện tại, sinh ra câu trả lời cuối gửi cho người dùng.

Trên thực tế, pattern này hữu ích nhất ở các tác vụ “lắp ghép nhiều bước suy luận nhỏ” thay vì một câu hỏi đơn lẻ. Sự khác biệt rõ nhất trong các pipeline gồm nhiều bước (multi-step workflows) — đó là lúc Advisor Tool thực sự phát huy.

Điểm mấu chốt cần nhớ

  • Opus làm Advisor, Sonnet/Haiku làm Executor — hai vai tách biệt trong cùng một pipeline.
  • Executor tự quyết định khi nào gọi Advisor thông qua Tool Call.
  • Không cần viết orchestration phức tạp, chỉ cần đăng ký Opus như một Tool.
  • Cơ chế này tái hiện pattern “senior review – junior implement” trong thế giới AI.

Advisor Tool trên SWE-bench cho kết quả ra sao?

SWE-bench là bộ benchmark tiêu chuẩn để đo khả năng model sửa lỗi phần mềm thực tế. Anthropic dùng chính bộ này để so sánh Sonnet đơn lẻ với Sonnet kết hợp Opus Advisor — và kết quả khá thú vị.

Khi chỉ dùng Sonnet làm Executor, độ chính xác đạt 72,1% trên tập lỗi SWE-bench với chi phí khoảng 1,09 USD cho cùng một workload. Đây là baseline quan trọng để đánh giá mức cải thiện sau khi gắn thêm Advisor.

Khi chuyển sang Sonnet (Executor) + Opus (Advisor), độ chính xác tăng lên 74,8% trên chính tập bài toán đó. Điểm bất ngờ là tổng chi phí lại giảm — trái với trực giác “dùng model đắt thì phải tốn hơn” mà nhiều người hay nghĩ.

Chi phí giảm vì Opus không xử lý toàn bộ request, mà chỉ được gọi rất có chọn lọc ở những chỗ Sonnet tự đánh giá là khó.

Tại sao model càng nhẹ thì Advisor Tool càng hiệu quả?

Khi ghép Opus với Haiku, hiệu ứng còn rõ hơn nữa. Haiku rẻ và nhanh, nhưng chất lượng kém hơn Sonnet và Opus. Khi có Opus làm Advisor, Haiku có thể “vay chất xám” ở những khúc suy luận khó mà vẫn giữ được phần lớn ưu thế chi phí.

Kết quả:

  • Mức tăng accuracy lớn nhất khi ghép Haiku với Opus.
  • Tổng chi phí để đạt chất lượng gần Opus đơn lẻ thấp hơn nhiều so với việc cho Opus chạy mọi thứ.

Đây là chiến lược đặc biệt hợp với team startup hoặc sản phẩm có khối lượng request lớn nhưng ngân sách hẹp — chatbot chăm sóc khách hàng, hệ thống hỗ trợ code nội bộ, hay bất kỳ pipeline nào chạy liên tục.

Điểm mấu chốt cần nhớ

  • SWE-bench xác nhận Sonnet+Opus Advisor chính xác hơn Sonnet đơn lẻ — và rẻ hơn.
  • Opus chỉ xử lý những đoạn khó do Sonnet chọn, đó là lý do cost giảm.
  • Ghép Opus với Haiku mang lại cải thiện chất lượng lớn nhất trên mỗi đồng chi phí bỏ ra.
  • Dự án bị siết ngân sách sẽ hưởng lợi nhiều nhất từ cơ chế này.

Demo du lịch Nhật: tại sao Sonnet+Opus Advisor lại thắng Opus đơn lẻ?

Demo du lịch Nhật là ví dụ trực quan nhất về cách Advisor Tool tối ưu cả chất lượng lẫn chi phí. Bài toán: lập kế hoạch du lịch 3 ngày ở Nhật với ngân sách 1.500 USD, ưu tiên ăn uống và tham quan, ngủ cố định ở Shinjuku.

Bốn kịch bản được so sánh song song: Haiku đơn lẻ, Sonnet đơn lẻ, Sonnet+Opus Advisor và Opus đơn lẻ. Setting này rất giống các use case thực tế — lập hành trình tour, đề xuất quán ăn ở Hà Nội hay Đà Nẵng, gợi ý lộ trình đi tỉnh.

Haiku thắng về tốc độ và giá. Nhưng khi vẽ hành trình lên bản đồ, nó cho một route tổng quãng đường lên tới 121 km — cực kỳ kém hiệu quả, kiểu lịch trình “hành xác” mà không du khách nào muốn.

Trong khi đó:

  • Sonnet đề xuất lộ trình khoảng 33,87 km.
  • Sonnet+Opus Advisor chỉ còn 28,5 km — ngắn nhất trong bốn kịch bản.
  • Opus đơn lẻ là 34,96 km.

Tức là về hiệu quả di chuyển, combo Sonnet+Opus Advisor thậm chí tốt hơn cả Opus chạy một mình.

Bảng so sánh nhanh 4 kịch bản demo

Mô hình Quãng đường di chuyển Chi phí ước tính
Haiku ~121 km Thấp nhất (gần như không đáng kể)
Sonnet ~33,87 km ~0,04 USD
Sonnet + Opus Advisor ~28,5 km ~0,06 USD
Opus ~34,96 km ~0,29 USD

Về chi phí, Sonnet+Opus Advisor tốn khoảng 0,06 USD trong khi Opus đơn lẻ lên tới 0,29 USD — gần gấp 5 lần. So với Sonnet đơn lẻ (0,04 USD), combo Advisor có tốn thêm chút, nhưng đổi lại lộ trình tối ưu hơn hẳn.

Kết quả thử nghiệm cho thấy mô hình “Opus lên kế hoạch, Sonnet thi công” giúp bạn mua được “chất lượng gần như Opus” với giá khoảng 1/5.

Pattern này rất hợp với các app B2C: người dùng nhận kết quả xịn — lộ trình đẹp, logic chuẩn — mà chi phí vận hành mỗi request đủ thấp để mở rộng lên hàng chục nghìn người dùng mà không lo hóa đơn nổ chậm.

Điểm mấu chốt cần nhớ

  • Haiku nhanh và rẻ, nhưng có thể cho ra kế hoạch cực kỳ kém tối ưu.
  • Sonnet+Opus Advisor cho quãng đường di chuyển ngắn nhất trong cả bốn kịch bản.
  • Chi phí Sonnet+Advisor chỉ khoảng 1/5 so với Opus đơn lẻ.
  • Mô hình “Opus planning – Sonnet implementation” là cấu trúc nên ưu tiên cho các app lập kế hoạch.

Làm thế nào để triển khai Claude Advisor Tool qua API?

Claude Advisor Tool là phần mở rộng của cơ chế Tool Call, nên cú pháp API gần như không thay đổi. Bạn chỉ cần đăng ký model Opus như một Tool trong mảng tools của request.

Cụ thể hơn: thay vì chỉ khai báo các tool như search, database_query hay call_internal_api, bạn thêm một tool tên kiểu opus_advisor, với implementation là model Opus. Khi Sonnet đang xử lý mà thấy cần, nó gọi Tool này, nhận câu trả lời rồi đưa luôn vào context.

Khi bạn thử triển khai lần đầu, learning curve gần như bằng 0 nếu đã dùng Claude Tools trước đó. Không cần viết thêm workflow orchestration, không cần callback phức tạp — chỉ thêm một định nghĩa tool và vài tham số kiểm soát.

Những tham số quan trọng khi dùng Advisor Tool

max_uses — giới hạn số lần gọi Advisor trong một phiên

Đây là tham số then chốt để khóa chi phí. Đặt max_uses = 3 nghĩa là trong suốt một conversation hoặc một job, Sonnet chỉ được phép hỏi Opus tối đa ba lần — dù nó có “muốn” hỏi thêm.

Hình thức trả về của Advisor

Có thể là plain text (phù hợp với giải thích, lập kế hoạch, phác thảo) hoặc nội dung được bọc nhẹ tùy thiết kế hệ thống. Cả hai đều được Executor đọc lại và đưa vào reasoning chain.

Xử lý lỗi riêng của Advisor

Nếu có lỗi khi gọi Opus — timeout, quota, lỗi định dạng input — hệ thống trả một mã lỗi riêng. Bạn nên log các lỗi này tách biệt với lỗi chung của Executor để debug dễ hơn.

Tương thích multi-turn và prompt caching

Advisor Tool hoạt động bình thường trong hội thoại nhiều lượt và tương thích với prompt caching. Token dùng bởi Advisor được tracking riêng để theo dõi cost.

Để tham khảo cú pháp mới nhất, bạn xem tài liệu chính thức của Anthropic:

Làm bước này an toàn về chi phí như thế nào?

  1. Bắt đầu với max_uses thấp — mức 1–2 là đủ để tránh chi phí bất ngờ trong môi trường thật.
  2. Log riêng mọi lần Advisor được gọi — lưu kèm input, output, số token và kết quả. Sau 1–2 tuần bạn sẽ có dataset để tối ưu phân bổ.
  3. So sánh cost/quality trước và sau khi bật Advisor — dùng cùng một bộ test nội bộ, ghi lại accuracy rate, thời gian và chi phí cho từng cấu hình.

Điểm mấu chốt cần nhớ

  • Advisor Tool dùng chung cú pháp Tool Call, chỉ cần thêm Opus như một Tool mới.
  • max_uses là khóa an toàn để giới hạn chi phí.
  • Advisor có mã lỗi riêng khi fail — log tách biệt để debug dễ hơn.
  • Multi-turn chat và prompt caching vẫn dùng được bình thường.

Streaming bị ảnh hưởng thế nào khi bật Advisor Tool?

Streaming giúp chatbot và IDE assistant trả lời mượt hơn rất nhiều — người dùng thấy text xuất hiện liên tục thay vì chờ đợi. Nhưng khi dùng Advisor Tool, có một giới hạn quan trọng cần biết: streaming sẽ tạm dừng trong thời gian Executor gọi Advisor.

Cụ thể, ngay khi Sonnet quyết định gọi Opus, luồng token đang stream ra cho người dùng sẽ ngắt tạm thời. Trong lúc Opus đang suy nghĩ và trả lời, màn hình không có token mới nào xuất hiện — tạo ra một khoảng trắng đáng chú ý. Lý do đơn giản: Tool Call bản chất không stream, nó phải đợi kết quả đầy đủ của Tool rồi mới tiếp tục.

Trong demo của Anthropic, người xem thấy rõ khoảng “im lặng” này: Sonnet dừng stream, chờ Opus trả lời xong, rồi mới tiếp tục stream kết quả đã hợp nhất.

Nếu bạn thiết kế UI không cẩn thận, người dùng sẽ tưởng hệ thống bị đơ — đúng lúc Advisor đang giúp bạn suy luận phần quan trọng nhất.

Một điểm kỹ thuật nữa: max_tokens bạn đặt cho Executor không áp dụng lên output của Advisor. Nói cách khác, Opus có thể tạo output dài hơn nhiều so với trần token của Sonnet, và chi phí đó vẫn được tính riêng.

Cần tránh lỗi gì trong UX và cấu hình?

Đừng để khoảng trống im lặng khi Advisor chạy. Hãy hiển thị loading indicator, spinner, progress bar, hoặc một message kiểu “Đang nhờ chuyên gia phân tích…” để người dùng hiểu chuyện gì đang xảy ra.

Đừng nghĩ max_tokens đã bảo vệ bạn khỏi cost Advisor. Vì hạn mức này không áp dụng cho Opus, bạn phải dùng max_uses và nếu có thể, thêm logic cắt bớt độ dài output Advisor.

Đo lại thời gian phản hồi end-to-end. Advisor giúp tăng chất lượng nhưng cũng có thể kéo dài thời gian trả lời. Người dùng có thể chấp nhận chờ lâu hơn trong báo cáo phân tích, nhưng không phải trong chatbot CSKH — hãy biết context của bạn.

Điểm mấu chốt cần nhớ

  • Streaming tạm dừng khi Advisor được gọi — người dùng không thấy token mới trong khoảng đó.
  • Cần loading indicator hoặc message giải thích để tránh cảm giác “app bị đơ”.
  • max_tokens của Executor không giới hạn output của Advisor.
  • Kết hợp max_uses và monitoring để kiểm soát cost.

Trong tình huống nào bạn nên dùng Advisor Tool, và khi nào không nên?

Advisor Tool phát huy rõ nhất khi bạn đang dùng Sonnet hoặc Haiku vì chi phí mà vẫn muốn tiệm cận chất lượng của Opus. Tài liệu chính thức của Anthropic nói khá thẳng: nếu bạn dùng Sonnet cho các nhiệm vụ phức tạp, thêm Opus làm Advisor để nâng chất lượng với chi phí tương đương hoặc thấp hơn dùng Opus đơn lẻ.

Hiện có ba combo được hỗ trợ chính thức: Haiku+Opus, Sonnet+Opus và Opus+Opus. Về mặt lý thuyết, Opus+Opus phù hợp cho bài toán siêu phức tạp, nhưng xét về chi phí, Sonnet+Opus Advisor là điểm cân bằng tốt nhất cho phần lớn ứng dụng.

Nguyên tắc đơn giản: càng nhiều bước suy luận, càng nhiều bất định, càng đáng để bật Advisor Tool.

Khi nào nên dùng?

Các tác vụ đa bước, nhiều nhánh suy luận — phân tích luật, lập chiến lược kinh doanh, phân tích dữ liệu phức tạp, thiết kế kiến trúc hệ thống.

Sinh code hoặc refactor trên codebase lớn — đặc biệt khi xử lý các issue kiểu SWE-bench: bug fix, feature addition, migration framework.

Viết báo cáo dài, phân tích chuyên sâu — phân tích tài chính, báo cáo sản phẩm, đề xuất chiến lược tăng trưởng cho startup.

AI agent chạy dài, tự động hóa nhiều tác vụ — agent có thể gọi Opus tại các decision point quan trọng rồi để model nhẹ lo phần còn lại.

Khi nào không cần?

  • Tác vụ ngắn, lặp lại, cấu trúc rõ ràng: chuẩn hóa format văn bản, tóm tắt đơn giản, sửa chính tả.
  • Chatbot FAQ với câu hỏi đơn giản, xử lý form, phân loại ticket cơ bản.
  • Bất kỳ tình huống nào mà chất lượng hiện tại đã “đủ dùng” và cost per request đã đủ thấp.

Cách an toàn nhất theo kinh nghiệm của tôi: đánh dấu trong pipeline những node có “nhu cầu suy luận cao” — bước ra quyết định cuối cùng, bước thiết kế chiến lược — rồi chỉ bật Advisor ở những node đó. Đừng bật cho toàn bộ pipeline.

Điểm mấu chốt cần nhớ

  • Advisor Tool lý tưởng khi bạn phải dùng model rẻ nhưng cần chất lượng của Opus.
  • Sonnet+Opus Advisor là cấu hình cân bằng nhất giữa chi phí và chất lượng.
  • Không cần Advisor cho nhiệm vụ ngắn, đơn giản, lặp lại.
  • Gắn Advisor vào những bước suy luận “có stake cao” trong pipeline — không phải mọi chỗ.

Advisor Tool đang thay đổi cách thiết kế AI agent ra sao?

Advisor Tool là bước chuyển từ kiến trúc “một model làm tất cả” sang mô hình multi-model theo vai trò. Trong thế giới agent, điều này giống như một junior developer code chính, còn senior architect chỉ nhảy vào khi cần review hoặc quyết định hướng đi.

Về chi phí, đây là câu trả lời khá trực diện cho bài toán muôn thuở: chất lượng hay ngân sách. Các công ty vận hành sản phẩm AI — từ SaaS tới nền tảng nội bộ — thường mắc kẹt giữa hai cực: dùng model mạnh thì cháy ví, dùng model nhẹ thì người dùng phàn nàn. Advisor Tool cho phép “bật/tắt sự thông minh đắt đỏ” đúng nơi, đúng lúc.

Với AI agent tự động chạy hàng giờ, hàng ngày, mô hình hỗn hợp càng hữu ích. Một agent dài hơi hoàn toàn có thể dùng Haiku/Sonnet để crawl, gọi API, xử lý routine — và chỉ hỏi Opus khi phải thay đổi chiến lược, xác nhận giải pháp, hoặc ra quyết định rủi ro cao.

Không thể phủ nhận rằng pattern “advisor–executor” đang trở thành hướng thiết kế quan trọng cho agentic AI — giống như pattern “service–worker” trong kiến trúc microservices vậy.

Với thị trường Việt Nam, nơi chi phí hạ tầng và biên lợi nhuận luôn là bài toán nhức đầu, đây là cơ hội thực tế: đưa trải nghiệm “siêu thông minh” vào app mà không phải đội giá bán hoặc chấp nhận margin mỏng.

Điểm mấu chốt cần nhớ

  • Advisor Tool thúc đẩy kiến trúc multi-model theo vai trò trong thiết kế AI agent.
  • Bật “trí tuệ đắt tiền” của Opus đúng lúc — không phải mọi lúc.
  • Agent dài hơi hưởng lợi lớn khi dùng model nhẹ cho routine và Opus cho quyết định chiến lược.
  • Với bối cảnh chi phí nhạy cảm như Việt Nam, pattern này đáng áp dụng sớm.

Checklist thực chiến trước khi đưa Advisor Tool vào sản phẩm

Advisor Tool mạnh, nhưng dùng không khéo vẫn có thể đốt tiền và làm UX tệ hơn. Đây là chỗ khó khăn mà nhiều team bỏ qua: họ thấy benchmark đẹp rồi bật production ngay, không có guardrail nào.

Tôi đã thấy không ít team vội bật model mạnh trong production rồi phải tắt gấp vì hóa đơn tăng sốc. Với Advisor Tool, bạn có lợi thế là kiểm soát được biên độ sử dụng Opus — miễn là bạn chủ động thiết kế giới hạn từ đầu.

Những việc cần làm trước khi bật Advisor Tool

Xác định đúng “điểm đau suy luận” trong pipeline. Khoanh vùng những bước đòi hỏi suy luận phức tạp, không ổn định, hoặc gây lỗi nhiều. Tránh bật Advisor ở toàn bộ pipeline.

Thiết lập max_uses như một “trần chi phí mềm”. Bắt đầu với mức 1–2 cho mỗi job hoặc conversation. Sau khi có số liệu cost/quality, bạn mới nới dần.

Thiết kế UX cho khoảng trống streaming. Thêm loader, skeleton UI, hoặc message giải thích khi hệ thống đang gọi “chuyên gia” — nhất là trong ứng dụng chat và IDE plugin.

Lên kế hoạch benchmark nội bộ. Chọn vài kịch bản tiêu biểu (sinh code, trả lời khách hàng, lập kế hoạch marketing), chạy thử bốn cấu hình: Haiku, Sonnet, Sonnet+Advisor, Opus; so sánh accuracy, thời gian, cost.

Chuẩn bị hệ thống logging chi tiết. Log: model, số token, thời gian, có dùng Advisor hay không, kết quả có thành công không. Đây là cơ sở duy nhất để tối ưu thực sự.

Không có benchmark và logging, việc dùng Advisor Tool giống như bật một công tắc “AI mạnh hơn” mà không biết mình đang trả thêm bao nhiêu tiền cho mỗi 1% chất lượng.

Điểm mấu chốt cần nhớ

  • Xác định chính xác chỗ nào trong pipeline thực sự cần Advisor trước khi bật.
  • max_uses là bắt buộc nếu bạn không muốn cost nổ tung.
  • Xử lý UX cho khoảng trống streaming ngay từ đầu.
  • Benchmark nội bộ và logging là điều kiện cần để tối ưu lâu dài.

Nên bắt đầu từ đâu? Lộ trình hành động trong 30 ngày

Lộ trình này giúp bạn triển khai Claude Advisor Tool có kiểm soát trong vòng 1 tháng, ngay cả khi team nhỏ và bận.

Tuần 1: Hiểu và mô phỏng nhỏ

  • Chọn 1–2 use case quan trọng (sinh code, lập kế hoạch, trả lời email phức tạp).
  • Dùng playground hoặc script đơn giản so sánh Sonnet, Opus, Sonnet+Advisor về chất lượng cảm nhận.

Tuần 2: Tích hợp thử nghiệm trong môi trường dev

  • Thêm Opus vào tools của Claude API với max_uses = 1–2.
  • Cài logging chi tiết cho mọi lần gọi Advisor và tổng cost per request.

Tuần 3: Benchmark nội bộ có cấu trúc

  • Chuẩn hóa bộ test (10–50 case thật từ sản phẩm hiện tại).
  • Chạy 4 cấu hình: Haiku, Sonnet, Sonnet+Advisor, Opus; so sánh accuracy, thời gian, cost.

Tuần 4: Tối ưu và rollout có kiểm soát

  • Chọn cấu hình tốt nhất (thường là Sonnet+Advisor) và điều chỉnh max_uses.
  • Rollout dần cho 10–20% người dùng, tiếp tục theo dõi cost/quality trước khi mở rộng.

Bạn nên bắt đầu như thế nào từ hôm nay?

Tóm tắt hành động cụ thể

  • Khoanh vùng 1 use case phức tạp nhất trong sản phẩm hiện tại (sinh code, lập kế hoạch phức tạp, phân tích báo cáo).
  • Tạo một nhánh code thử nghiệm, thêm Opus vào tools và đặt max_uses = 1–2.
  • Chạy một vòng benchmark nhỏ với 10–20 case thực tế, ghi lại chất lượng, thời gian, chi phí.
  • So sánh Sonnet+Advisor với Opus đơn lẻ — nếu chi phí giảm mà chất lượng tương đương, hãy cân nhắc rollout rộng hơn.
  • Thiết kế UX cho khoảng trống streaming và hoàn thiện logging trước khi cho người dùng thật sử dụng.

Câu hỏi thường gặp

Q: Claude Advisor Tool là gì và khác gì so với việc gọi trực tiếp model Opus?

A: Claude Advisor Tool cho phép Sonnet hoặc Haiku gọi Opus như một Tool khi gặp đoạn suy luận khó. Thay vì để Opus xử lý toàn bộ request, nó chỉ được dùng có chọn lọc — nên tổng chi phí thường thấp hơn, nhưng chất lượng vẫn tiệm cận Opus đơn lẻ.

Q: Có những cặp model nào được hỗ trợ chính thức với Advisor Tool?

A: Hiện có ba cặp chính: Haiku+Opus, Sonnet+Opus và Opus+Opus. Sonnet+Opus Advisor là cấu hình cân bằng nhất cho đa số ứng dụng. Haiku+Opus phù hợp khi bạn cần cực tối ưu về chi phí nhưng vẫn muốn chất lượng ổn.

Q: Làm sao để kiểm soát chi phí khi dùng Advisor Tool?

A: Dùng tham số max_uses để giới hạn số lần Executor được phép gọi Advisor trong một phiên. Ngoài ra, log riêng token mà Advisor tiêu thụ và chạy benchmark nội bộ để tìm điểm cân bằng tốt nhất giữa max_uses, chất lượng và chi phí.

Q: Streaming có hoạt động bình thường khi bật Advisor Tool không?

A: Streaming vẫn hoạt động, nhưng tạm dừng trong thời gian Executor gọi Advisor. Người dùng sẽ không thấy token mới trong khoảng đó, nên bạn cần thêm loading indicator hoặc thông báo để tránh hiểu nhầm hệ thống bị treo.

Q: Tôi đã tích hợp Claude API rồi, cần làm gì thêm để dùng Advisor Tool?

A: Nếu bạn đã dùng Tool Call, việc duy nhất là thêm Opus vào mảng tools với các tham số phù hợp như max_uses. Không cần học cú pháp mới — nhưng hãy bổ sung logging và chạy benchmark trước khi bật cho toàn bộ traffic.

Bài viết này có hữu ích không?

Nhận thêm những bài viết công nghệ miễn phí.

Theo dõi blog qua email

Nhập địa chỉ email của bạn để đăng ký theo dõi blog này và nhận thông báo về các bài mới qua email.


Khám phá thêm từ ProductiveTechTalk

Đăng ký để nhận các bài đăng mới nhất được gửi đến email của bạn.

Một phản hồi cho “Claude Advisor Tool: đừng build thêm app AI sai cách”

  1. Ảnh đại diện ProductiveTechTalk

    The point about “đừng coi Opus là default, hãy coi nó là ‘bảo hiểm’ cho Sonnet/Haiku” really hits home. Rất nhiều team (mình cũng từng) cứ bật model mạnh nhất cho mọi request rồi ngạc nhiên vì bill phình to. Cách đóng gói logic “chỉ gọi cố vấn khi thật sự cần” vào Advisor Tool nghe giống pattern bắt buộc phải có cho bất kỳ sản phẩm AI nào muốn scale mà vẫn sống nổi với budget.

    Source: https://www.youtube.com/watch?v=OvJp5Z3vCP8

Gửi phản hồi

Khám phá thêm từ ProductiveTechTalk

Đăng ký ngay để tiếp tục đọc và truy cập kho lưu trữ đầy đủ.

Tiếp tục đọc