
Claude Sonnet 5: Mô Hình Rẻ Hơn Bản Cao Cấp Nhưng Bắt Bạn Phải Quản Lý Chi Phí
Mô hình tầm trung của Anthropic giờ đã sánh ngang bản flagship ở hầu hết các bài kiểm tra hiệu năng — nếu bạn biết quản lý mức effort.
Claude Sonnet 5: Mô Hình Rẻ Hơn Bản Cao Cấp Nhưng Buộc Bạn Phải Quản Lý Chi Phí
Claude Sonnet 5 là mô hình đầu tiên trong lịch sử Anthropic mà tầm trung thực sự cạnh tranh với bản cao cấp trên hầu hết các benchmark về trí tuệ — nhưng lợi thế về chi phí chỉ hiện ra nếu bạn chủ động quản lý mức độ nỗ lực (effort level) của nó. Bỏ qua chi tiết này, bạn có thể phải trả nhiều hơn cho mỗi tác vụ so với việc dùng Opus 4.8.
Được phát hành vào ngày 30 tháng 6 năm 2026, Claude Sonnet 5 đại diện cho một bước ngoặt thực sự trong dòng sản phẩm của Anthropic. Không phải vì nó vượt qua Opus 4.8 để trở thành mô hình tốt nhất tuyệt đối — nó không hẳn làm được điều đó — nhưng vì đối với một loạt công việc tác nhân (agentic) trong thực tế, nó mang lại trí tuệ tương đương với chi phí thấp hơn khoảng 40% trên mỗi token. Vấn đề là Sonnet 5 được trang bị tính năng "adaptive thinking" (suy luận thích ứng) luôn được kích hoạt, cùng với một tokenizer mới tạo ra nhiều token hơn cho mỗi tác vụ. Nếu cấu hình sai, điều này có thể đảo ngược hoàn toàn phương trình chi phí.
Bài viết này đi sâu hơn bảng thông số kỹ thuật: cách nhìn nhận Sonnet 5 trong bối cảnh thực tế, khi nào nó thực sự là lựa chọn đúng đắn, khi nào không, và "cái bẫy mức độ nỗ lực" thực sự có nghĩa gì trong thực tiễn.
Claude Sonnet 5 Là Gì?
Claude Sonnet 5 (claude-sonnet-5) là mô hình tầm trung của Anthropic, được phát hành vào ngày 30 tháng 6 năm 2026, thay thế cho Claude Sonnet 4.6. Nó đứng thứ ba trong hệ thống phân cấp hiện tại của dòng sản phẩm:
Fable 5 > Opus 4.8 > Sonnet 5 > Haiku 4.5
Định vị của Anthropic là có chủ đích: "hiệu năng gần với Opus 4.8 với giá thấp hơn." Dữ liệu benchmark phần lớn xác nhận điều này — và trong một số đánh giá, Sonnet 5 còn ngang bằng hoặc nhích hơn một chút so với bản cao cấp. Cửa sổ ngữ cảnh 1 triệu token, adaptive thinking, và khả năng sử dụng công cụ tác nhân mạnh mẽ đưa nó vào một hạng mục khác so với phiên bản tiền nhiệm.
Các Benchmark: Sonnet 5 Thực Sự Đứng Ở Đâu
Những con số nổi bật từ tổng quan mô hình của Anthropic đáng để đọc kỹ, vì câu chuyện không phải là "Sonnet 5 gần bằng Opus 4.8" — nó phức tạp hơn thế.
| Benchmark | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| SWE-bench Verified | 79.6% | 85.2% | 88.6% |
| SWE-bench Pro | — | 63.2% | — |
| FrontierCode | 15.1% | 38.8% | — |
| Terminal-Bench 2.1 | — | 80.4% | ~82.7%* |
| GDPval-AA (Elo cho công việc tri thức) | — | 1618 | 1615 (≈ ngang bằng) |
| Humanity's Last Exam (có công cụ) | — | 57.4% | ~57.9% (gần ngang bằng) |
Điểm Terminal-Bench 2.1 của Opus 4.8 được báo cáo dao động từ ~74.6% đến 82.7% tùy vào harness, vì vậy hai mô hình này nên được hiểu là ngang tầm nhau hơn là một bên rõ ràng vượt trội hơn bên kia.
Con số FrontierCode là điều gây ấn tượng nhất: Sonnet 5 hơn gấp đôi điểm số của Sonnet 4.6 (15.1% → 38.8%). Đó không phải là tiến bộ dần dần; đó là một bước nhảy vọt về chất lượng trong việc tạo mã phức tạp. Về GDPval-AA — đo lường công việc tri thức nhiều bước, đòi hỏi khả năng phán đoán, đặc trưng cho các pipeline tác nhân hiện đại — Sonnet 5 (1618) ngang bằng với Opus 4.8 (1615), và trên Terminal-Bench 2.1, nó cạnh tranh ngang ngửa với bản cao cấp hơn là rõ ràng thua kém.
Đánh giá độc lập từ Artificial Analysis đặt Sonnet 5 ở Chỉ số Trí tuệ 53, xếp hạng #5 tổng thể. Phát hiện quan trọng hơn của họ: chi phí trên mỗi tác vụ khoảng 2,29 đô la, thực tế đắt hơn khoảng 15% so với Opus 4.8 trên các tác vụ tương đương. Chúng ta sẽ trở lại vấn đề này vì nó rất quan trọng.
Sonnet 5 thu hẹp khoảng cách với bản cao cấp trên hầu hết các benchmark và ngang bằng với Opus 4.8 trên các benchmark về terminal và công việc tri thức. FrontierCode cho thấy sự cải thiện ấn tượng nhất so với Sonnet 4.6.
Tính Năng Thay Đổi Mọi Thứ: Adaptive Thinking
Mọi mô hình trước đây của Anthropic đều coi extended thinking (suy luận mở rộng) là tính năng tùy chọn. Sonnet 5 biến nó thành bắt buộc. Adaptive thinking luôn được kích hoạt, và bạn kiểm soát độ sâu của nó qua năm mức độ nỗ lực:
- low — suy luận tối thiểu, nhanh nhất, rẻ nhất
- medium — một lượt suy luận nhẹ
- high (mặc định) — mức được hầu hết các benchmark sử dụng
- xhigh — suy luận sâu, tạo ra nhiều token output hơn đáng kể
- max — ngân sách suy luận tối đa
Quyết định thiết kế này là trọng tâm của thách thức quản lý chi phí. Ở mức high (mặc định), Sonnet 5 với mức giá tiêu chuẩn tháng 9 là 3 đô la/triệu token input và 15 đô la/triệu token output rõ ràng rẻ hơn Opus 4.8 (5 đô la/25 đô la) đối với hầu hết tác vụ. Nhưng ở mức xhigh hoặc max, số token output tăng lên đáng kể — và kết hợp với tokenizer mới (được chia sẻ với Opus 4.7, 4.8, và Fable 5) tạo ra khoảng 1.0–1.35 lần nhiều token hơn so với các tokenizer cũ, bạn có thể thấy một tác vụ Sonnet 5 vượt qua chi phí của lệnh gọi Opus 4.8 tương đương.
Nhóm kỹ thuật của Zapier đã ghi nhận một điều thú vị: ở mức nỗ lực low, Sonnet 5 đã vượt qua Sonnet 4.6 chạy ở bất kỳ mức nỗ lực nào, và chi phí thấp hơn. Đó là trường hợp "cỗ máy rẻ tiền." Truy xuất đơn giản, tóm tắt, phân loại nhẹ, định tuyến tác vụ — mức low trên Sonnet 5 là mặc định mới cho những nhà phát triển quan tâm đến chi phí.
Bức Tranh Chi Phí Thực Tế: Giai Đoạn Giới Thiệu và Sau Đó
Việc định giá có hai giai đoạn:
| Giai đoạn | Input | Output | Ghi chú |
|---|---|---|---|
| Giới thiệu (đến 31/8/2026) | 2 đô la/triệu | 10 đô la/triệu | Nên tận dụng giai đoạn này |
| Tiêu chuẩn (từ 1/9/2026) | 3 đô la/triệu | 15 đô la/triệu | Mức giá tiêu chuẩn |
| Đọc từ prompt cache | Giảm đến 90% | Giảm đến 90% | Rất hiệu quả cho ngữ cảnh lặp lại |
| Batch API | Giảm 50% | Giảm 50% | Ngữ cảnh output 300k trong bản beta |
Giai đoạn giới thiệu rất quan trọng. Các workload tác nhân chạy hiện tại trên Sonnet 5 có chi phí 2 đô la/10 đô la — rẻ hơn 33% so với mức tiêu chuẩn. Nếu bạn đang xây dựng một pipeline, đây là thời điểm để thử nghiệm và tối ưu hóa với chi phí biên thấp trước khi mức giá tháng 9 có hiệu lực. Trang Sonnet của Anthropic có thông tin định giá hiện tại.
Một tính năng ít được đánh giá đúng mức: việc lưu cache prompt giảm đến 90% giúp Sonnet 5 cực kỳ hiệu quả cho loại công việc tác nhân với ngữ cảnh dài, khi bạn liên tục đọc lại cùng một repository, tập hợp tài liệu, hoặc schema công cụ. Đối với những mẫu hình này, chi phí thực tế có thể giảm xuống thấp hơn nhiều so với các con số nổi bật.
Sonnet 5 so với Opus 4.8 so với Haiku 4.5: Một Khung Quyết Định Thực Tế
Lời khuyên tiêu chuẩn — "dùng mô hình cao cấp cho tác vụ khó, mô hình tầm trung cho tác vụ trung bình, mô hình nhỏ cho tác vụ đơn giản" — không còn đúng với Sonnet 5. Dữ liệu benchmark buộc chúng ta phải nhìn nhận chi tiết hơn.
Khi Sonnet 5 rõ ràng là lựa chọn đúng
Coding tác nhân và công việc terminal. Sonnet 5 đạt 80.4% trên Terminal-Bench 2.1 — ngang bằng với Opus 4.8 hơn là rõ ràng thua kém — và điểm FrontierCode của nó hơn gấp đôi so với thế hệ trước. Đối với loại tác nhân coding đầu-cuối — viết, chạy, kiểm tra output, lặp lại — vốn định hình các workflow AI sản xuất hiện nay, Sonnet 5 vẫn đứng vững. Nhóm Zapier đặc biệt nhấn mạnh rằng các tác vụ tác nhân "trước đây hay bị đình trệ" trong các mô hình cũ hơn nay hoàn thành trọn vẹn. Nó còn được cho là "tự kiểm tra output của chính mình mà không cần được yêu cầu," giảm nhu cầu về các vòng kiểm tra rõ ràng.
Công việc tri thức và pipeline nghiên cứu. Elo GDPval-AA là 1618 (so với 1615 của Opus 4.8) gần như là một sự ngang bằng về mặt thống kê — điểm mấu chốt là Sonnet 5 gần như không hy sinh chất lượng công việc tri thức nào để tiết kiệm chi phí. Đối với tóm tắt nghiên cứu, xử lý tài liệu, và suy luận nhiều bước trên ngữ cảnh dài — đặc biệt với cửa sổ 1M token — Sonnet 5 ở mức nỗ lực high giữ vững vị thế của mình trước bản cao cấp.
Bất cứ điều gì cần cửa sổ ngữ cảnh 1M. Cả Sonnet 5 và Opus 4.8 đều cung cấp ngữ cảnh 1 triệu token. Nhưng với mức giá của Sonnet 5, việc phân tích codebase 500 nghìn token có chi phí thấp hơn đáng kể cho mỗi lệnh gọi.
Sản xuất API khối lượng lớn. Với mức giá tiêu chuẩn, Sonnet 5 rẻ hơn 40% trên mỗi token so với Opus 4.8. Ở quy mô lớn, điều này tích lũy rất nhanh.
Khi Opus 4.8 vẫn đáng dùng
Các tác vụ mà độ biến động của chất lượng output quan trọng hơn chất lượng trung bình. Khoảng cách trên SWE-bench Verified (85.2% so với 88.6%) là 3.4 điểm. Trên thực tế, điều này nghĩa là Opus 4.8 hoàn thành đúng một tỷ lệ cao hơn các tác vụ coding khó. Đối với các hành động không thể đảo ngược, workflow nhạy cảm về tuân thủ, hoặc các tác vụ mà một câu trả lời sai gây tốn kém hơn khoản chênh lệch giá API, hãy trả tiền cho bản cao cấp.
Khi bạn cần hiệu năng đỉnh được đảm bảo. Sonnet 5 trung bình sánh ngang với Opus 4.8 — nhưng Opus 4.8 nhất quán hơn ở mức cao trong phạm vi khả năng của nó. Nếu bạn đang làm phân tích quan trọng một lần và không dễ dàng lặp lại, Opus 4.8 vẫn có ưu thế.
Khi Haiku 4.5 là câu trả lời hiển nhiên
Định tuyến, phân loại, tóm tắt nhẹ, hỏi đáp đơn giản, bất cứ điều gì chạy 50+ lần mỗi phiên người dùng. Claude Haiku 4.5 với giá 1 đô la/5 đô la thực sự đủ khả năng cho các mẫu hình này, và Sonnet 5 ở mức nỗ lực low không đủ để biện minh cho mức giá gấp 3 lần đối với các tác vụ đơn giản. Xây dựng một lớp định tuyến — dùng Haiku cho khối lượng lớn, Sonnet 5 cho độ phức tạp trung bình, Opus 4.8 cho các trường hợp khó — và bạn sẽ giảm chi phí đáng kể so với phương pháp dùng một mô hình duy nhất.
Cái Bẫy Chi Phí Ở Mức Độ Nỗ Lực
Đây là phần trong câu chuyện về Sonnet 5 mà hầu hết các bài đưa tin đều bỏ lỡ hoàn toàn.
Adaptive thinking luôn được kích hoạt. Ở mức nỗ lực max, Sonnet 5 có thể dễ dàng tạo ra 2–3 lần số token output so với cùng tác vụ ở mức low. Kết hợp với việc tokenizer mới làm tăng số token lên 1.0–1.35 lần so với các mô hình cũ, một nhà phát triển đưa Sonnet 5 vào pipeline sản xuất với mức nỗ lực mặc định (hoặc high) mà không đo lường số token thực tế có thể dễ dàng tốn nhiều hơn cho mỗi tác vụ so với việc dùng Opus 4.8 ở mức nỗ lực thấp hơn.
Artificial Analysis đã xác nhận điều này bằng thực nghiệm: chi phí trên mỗi tác vụ của Sonnet 5 trên bộ benchmark tác nhân của họ là khoảng 2,29 đô la, cao hơn khoảng 15% so với Opus 4.8. Điều này ban đầu nghe có vẻ phi lý — làm sao mô hình rẻ hơn lại có thể tốn nhiều hơn cho mỗi tác vụ? Câu trả lời là sự phình to số token từ suy luận: mức nỗ lực mặc định high khiến Sonnet 5 tiêu tốn token vào việc suy nghĩ mà Opus 4.8 không cần phải làm (hoặc làm một cách ngầm định mà không tạo ra nhiều token suy luận).
Hướng dẫn thực tiễn:
- Mặc định dùng
lowcho bất cứ điều gì không cần suy luận nhiều bước. Ở mức nỗ lựclow, Sonnet 5 vẫn vượt qua Sonnet 4.6 ở bất kỳ mức nỗ lực nào trên hầu hết các benchmark. - Dùng
high(mặc định) cho các tác vụ tác nhân mà chất lượng suy luận quan trọng. Đây là mức mà các benchmark sử dụng và là nơi các so sánh với Opus 4.8 vẫn đúng. - Dành riêng
xhigh/maxcho các vấn đề thực sự khó — gỡ lỗi phức tạp, nghiên cứu mới, suy luận đạt chuẩn kỳ thi. Đây là những tác vụ duy nhất mà chi phí token bổ sung là chính đáng. - Đo lường số token thực tế cho mỗi tác vụ trước khi triển khai lên sản xuất. Tokenizer mới có nghĩa là các ước tính chi phí Sonnet 4.6 của bạn sẽ không còn chính xác.
Đối với các nhóm xây dựng trên Happycapy hoặc trực tiếp trên API, đây không phải là một quy tắc tùy chọn — đây là sự khác biệt giữa việc Sonnet 5 rẻ hơn Opus 4.8 40% hay đắt hơn đáng kể. Bắt đầu miễn phí tại happycapy.ai để chạy so sánh song song giữa các mức nỗ lực trước khi cam kết vào một cấu hình cụ thể.
Trải Nghiệm Thực Tế Khi Sử Dụng Sonnet 5
Ứng dụng web claude.ai hiện dùng Sonnet 5 làm mô hình mặc định cho cả gói Free và Pro. Phản hồi ban đầu từ cộng đồng nói chung là tích cực về khả năng — kèm với những lưu ý đáng chú ý.
Điều đang hoạt động tốt: Khả năng theo đuổi công việc tác nhân là lời khen phổ biến nhất. Các kỹ sư báo cáo rằng các tác vụ nhiều bước từng cần điểm can thiệp của con người trong Sonnet 4.6 nay hoàn thành một cách tự động. Mô hình tự kiểm tra output đáng tin cậy hơn — chạy một bài test, thấy nó thất bại, sửa mã, và chạy lại mà không cần được yêu cầu rõ ràng. Điều này giảm bớt lượng mã "khung sườn" bạn cần viết cho các pipeline tác nhân.
Điều gây khó chịu: Việc từ chối quá mức là lời phàn nàn phổ biến nhất trong giao diện web. Một số người dùng mô tả nó như những "rào chắn hoang tưởng" ngăn cản các yêu cầu sáng tạo hoặc kỹ thuật hợp lý. Cần lưu ý rằng phần lớn hành vi này có vẻ đặc thù cho system prompt của claude.ai hơn là một sự thoái lui của mô hình được ghi nhận — các nhà phát triển dùng trực tiếp API báo cáo ít vấn đề hơn. Liên quan: một số người dùng cảm thấy mô hình đã mất một chút sự ấm áp hoặc "cá tính" riêng biệt so với các phiên bản Sonnet trước đây.
Vấn đề đọc quá nhiều trong công việc tác nhân: Xu hướng của Sonnet 5 đọc một lượng lớn ngữ cảnh trước khi hành động — đọc "hàng chục nghìn dòng cho các câu hỏi đơn giản," theo một số báo cáo — là có thật và xuất phát trực tiếp từ việc adaptive thinking luôn được kích hoạt. Mô hình cố gắng làm mọi thứ thật kỹ càng. Trong một tác nhân có quyền truy cập vào codebase lớn, điều này có thể tiêu hao token rất nhanh. Việc hạn chế quyền truy cập ngữ cảnh ở cấp độ công cụ hiệu quả hơn là chống lại xu hướng tự nhiên của mô hình.
Cửa Sổ Ngữ Cảnh và Thông Số Kỹ Thuật
| Thông số | Giá trị |
|---|---|
| Cửa sổ ngữ cảnh | 1.000.000 token |
| Output tối đa (tiêu chuẩn) | 128.000 token |
| Output tối đa (Batch API beta) | 300.000 token |
| Phương thức input | Văn bản + hình ảnh |
| Phương thức output | Chỉ văn bản |
| Ngưỡng kiến thức | Tháng 1 năm 2026 |
| Adaptive thinking | Luôn kích hoạt (5 mức) |
| Định danh API | claude-sonnet-5 |
Cửa sổ ngữ cảnh 1M chỉ được Opus 4.8 sánh bằng trong dòng sản phẩm hiện tại. Đối với các trường hợp sử dụng liên quan đến phân tích toàn bộ codebase, tài liệu pháp lý dài, hoặc tổng hợp nghiên cứu từ nhiều tài liệu, điều này có ý nghĩa quan trọng — và với mức giá của Sonnet 5, các lệnh gọi ngữ cảnh lớn có chi phí thấp hơn đáng kể so với lệnh gọi Opus 4.8 tương đương.
Không hỗ trợ input hoặc output âm thanh. Văn bản và hình ảnh vào, văn bản ra.
Khả Năng Sử Dụng: Chạy Sonnet 5 Ở Đâu
Sonnet 5 có sẵn trên hầu hết mọi kênh triển khai lớn:
- claude.ai — mô hình mặc định cho gói Free và Pro
- Anthropic API — ID mô hình
claude-sonnet-5 - Claude Code — có sẵn làm backend cho tác nhân coding
- AWS Bedrock — được triển khai tại các khu vực được hỗ trợ
- Google Vertex AI — có sẵn qua Vertex model garden
- Microsoft Foundry — có sẵn cho các triển khai doanh nghiệp
- Happycapy — Sonnet 5 là một trong hơn 150 mô hình có sẵn trong sandbox chạy trên trình duyệt
Góc nhìn về Happycapy đáng được nhấn mạnh cho các nhà phát triển muốn đánh giá Sonnet 5 so với các lựa chọn thay thế mà không cần quản lý API key hay hạ tầng. Bạn có thể chạy Sonnet 5 song song với Opus 4.8, Haiku 4.5, và các mô hình từ các nhà cung cấp khác — tất cả với khả năng sử dụng công cụ, pipeline tác nhân, và truy cập file trong một sandbox trên trình duyệt. Đối với việc thử nghiệm mức độ nỗ lực đã mô tả ở trên, môi trường so sánh song song như vậy thực sự hữu ích trước khi bạn cam kết vào một cấu hình sản xuất.
Đối với các nhà phát triển làm việc trên các ứng dụng Claude-native, hãy xem Claude Code SDK và hướng dẫn kỹ thuật harness để biết các mẫu hình tích hợp, và agentic AI vs. AI agents để hiểu khung khái niệm về vị trí của Sonnet 5 trong các pipeline tự động.
Kết Luận: Trí Tuệ Trên Mỗi Đô La, Được Quản Lý
Cách diễn đạt nắm bắt đúng nhất bản chất vấn đề: Sonnet 5 chồng lấp với tầm cao cấp với mức giá khoảng 40% thấp hơn trên mỗi token ở mức giá tiêu chuẩn. Dữ liệu benchmark xác nhận điều này cho hầu hết các workload. Nhưng câu quan trọng hơn là câu từ Artificial Analysis: trên thực tế, chi phí trên mỗi tác vụ có thể cao hơn Opus 4.8 nếu mức nỗ lực không được quản lý.
Sonnet 5 là mô hình Sonnet đầu tiên xứng đáng được xem xét thực sự so với bản cao cấp — không phải là một sự thỏa hiệp, mà là lựa chọn mặc định cho một loạt công việc thực tế rộng lớn. Ý nghĩa đối với các nhà phát triển là một sự thay đổi trong tư duy: câu hỏi khó trước đây là "mô hình nào?" Nay là "mô hình nào ở mức nỗ lực nào, và việc đo lường token của tôi có thực sự phản ánh đúng sự thật không?"
Đó là một câu hỏi đòi hỏi nhiều hơn. Nhưng đó cũng là dấu hiệu cho thấy tầm trung đã thực sự trưởng thành.
Bắt đầu miễn phí tại happycapy.ai để chạy Sonnet 5 cùng với hơn 150 mô hình khác trong một sandbox trên trình duyệt với đầy đủ quyền truy cập công cụ — không cần API key.
Để so sánh với thế hệ hiện tại của các mô hình tập trung vào coding, hãy xem hướng dẫn best AI agent for coding và bài phân tích Claude Code vs. Cursor của chúng tôi.
Câu Hỏi Thường Gặp: Claude Sonnet 5
Claude Sonnet 5 là gì?
Claude Sonnet 5 là mô hình AI tầm trung của Anthropic, được phát hành vào ngày 30 tháng 6 năm 2026. Đây là mô hình có khả năng cao thứ ba trong dòng sản phẩm hiện tại của Anthropic (sau Fable 5 và Opus 4.8) và có cửa sổ ngữ cảnh 1 triệu token, adaptive thinking luôn được kích hoạt, và hiệu năng coding tác nhân mạnh mẽ. Định danh API: claude-sonnet-5.
Claude Sonnet 5 so sánh với Opus 4.8 như thế nào?
Trên hầu hết các benchmark, Sonnet 5 tiến gần với Opus 4.8 và ngang bằng với nó trên các tác vụ terminal và Elo công việc tri thức. Sonnet 5 được định giá 3 đô la/triệu token input và 15 đô la/triệu token output so với 5 đô la/25 đô la của Opus 4.8. Tuy nhiên, adaptive thinking luôn kích hoạt của Sonnet 5 có thể làm chi phí thực tế cho mỗi tác vụ cao hơn dự kiến — Artificial Analysis đo được khoảng 2,29 đô la mỗi tác vụ, cao hơn khoảng 15% so với Opus 4.8, do lượng token output từ suy luận. Ở các mức nỗ lực được kiểm soát, Sonnet 5 là lựa chọn tốt hơn cho hầu hết workload sản xuất.
Giá của Claude Sonnet 5 là bao nhiêu?
Đến ngày 31 tháng 8 năm 2026: 2 đô la/triệu token input, 10 đô la/triệu token output (giá giới thiệu). Từ ngày 1 tháng 9 năm 2026: 3 đô la/triệu input, 15 đô la/triệu output. Prompt caching có sẵn với mức giảm giá đến 90% cho ngữ cảnh lặp lại; Batch API (giảm 50%) hỗ trợ đến 300 nghìn token output trong bản beta.
Claude Sonnet 5 có miễn phí sử dụng không?
Có — Claude Sonnet 5 là mô hình mặc định trên gói Free của claude.ai, vì vậy bạn có thể sử dụng nó mà không cần trả tiền. Giới hạn sử dụng áp dụng trên gói miễn phí. Trên Happycapy, bạn cũng có thể chạy Sonnet 5 với tài khoản miễn phí cùng với hơn 150 mô hình khác trong một sandbox trên trình duyệt có hỗ trợ công cụ.
Cửa sổ ngữ cảnh của Claude Sonnet 5 là bao nhiêu?
1.000.000 token (1M). Output tối đa là 128.000 token cho các lệnh gọi API tiêu chuẩn, và đến 300.000 token qua Batch API beta.
Claude Sonnet 5 so sánh với Sonnet 4.6 như thế nào?
Mạnh hơn đáng kể trên mọi mặt. SWE-bench Verified cải thiện từ 79.6% lên 85.2%. FrontierCode hơn gấp đôi (15.1% → 38.8%). Cửa sổ ngữ cảnh mở rộng lên 1M token. Adaptive thinking nay luôn được kích hoạt. Đáng chú ý, Sonnet 5 ở mức nỗ lực low đã vượt qua Sonnet 4.6 ở bất kỳ mức nỗ lực nào trên hầu hết tác vụ — và chi phí trên mỗi token thấp hơn.
Adaptive thinking là gì, và tôi có thể tắt nó trong Sonnet 5 không?
Adaptive thinking là tính năng suy luận nội bộ mở rộng của Anthropic — mô hình suy luận qua các vấn đề trước khi trả lời. Trong Sonnet 5, nó luôn được kích hoạt và không thể tắt. Bạn kiểm soát độ sâu qua năm mức độ nỗ lực (low/medium/high/xhigh/max), với high là mặc định. Các mức nỗ lực cao hơn tạo ra nhiều token suy luận hơn và tăng chi phí; mức nỗ lực low là thiết lập tiết kiệm chi phí nhất cho các tác vụ đơn giản.
Mức độ nỗ lực là công cụ điều chỉnh chi phí chính trong Sonnet 5. Ở mức low, nó vượt trội Sonnet 4.6 cả về chi phí và chất lượng. Ở mức xhigh/max, sự phình to token có thể đẩy chi phí mỗi tác vụ vượt qua Opus 4.8.

