- Anthropic vừa công bố Claude Opus 5 vào 24/7/2026, một mô hình AI giải quyết câu hỏi mà ngành công nghiệp chờ đợi: làm sao có hiệu năng gần-biên-giới (near-frontier) mà không tốn kém.
- Opus 5 vượt Fable 5 trên Frontier-Bench (43.3% vs 33.7%) với mức giá chỉ bằng nửa - $5/M input token so với $10/M của Fable 5.
- Khả năng tự kiểm tra (self-verification) và lập trình agentic của nó gấp đôi Opus 4.8, mở ra chiến thuật mới cho startups và doanh nghiệp.
TL;DR
Anthropic công bố Claude Opus 5 - mô hình AI cải tiến giá rẻ với hiệu năng gần biên giới:
- Hiệu năng: Vượt Fable 5 (flagship) trên Frontier-Bench (43.3% vs 33.7%), ARC-AGI 3 (30.2% vs ~0%), GDPval-AA v2 (1,861 Elo vs 1,747).
- Giá: $5/$25 per M tokens - bằng Opus 4.8, rẻ bằng nửa Fable 5 ($10/$50).
- Khả năng mới: Tự kiểm tra công việc của mình, extended thinking (mặc định), effort dial cho phép điều chỉnh cost/reasoning.
- Lợi thế: Lập trình agentic gấp 2.3x Opus 4.8, computer use vượt Fable 5 ở 1/3 giá, ít hạn chế hơn (safety classifiers kích hoạt 85% ít hơn).
- Khả dụng: Hôm nay trên Claude.ai, Claude API, Claude Code, Amazon Bedrock, Google Cloud, Microsoft Foundry. 1M token context, 128K max output.
Opus 5 là gì?
Opus 5 là phiên bản thứ 4 trong dòng Opus - vị trí "hàng ngày" của Anthropic. Nó đứng giữa Sonnet 5 (mô hình nhẹ) và Fable 5 (mô hình flagship), nhưng với một điểm bất ngờ: hiệu năng gần bằng Fable 5, giá chỉ bằng nửa.
Không phải mô hình "giảm giá" bình thường. Opus 5 tích hợp hành vi tự kiểm tra cách một lập trình viên frontend thực thụ - nó mở các trang ở độ rộng desktop và mobile, phát hiện các nút bị ẩn dưới, sửa chữa trước khi giao - trước khi bạn phải quay lại yêu cầu sửa chữa.
Tại sao bây giờ?
Ba tháng qua, Anthropic ra mắt một loạt mô hình nhanh chóng: Mythos 5, Fable 5, Sonnet 5 (tháng 6). Opus 5 là chiếc mũi nhọn cuối cùng - hoàn thành bộ sưu tập 5 nhưng với một vị trí tuyến tính độc đáo: thay vì chỉ là "Opus 4.8 cải tiến", nó là Fable 5 giảm giá nhưng không giảm yêu cầu.
Thị trường đã chờ đợi điều này. Các công ty phàn nàn về OpenAI's GPT-5 Sol - mạnh, nhưng đắt mà không rõ liệu nó có xứng đáng không. Opus 5 nói: nếu bạn cần một mô hình gần biên giới, hãy chọn Opus 5 với nửa chi phí, hoặc chọn Fable 5 nếu bạn thực sự cần frontier đó mỗi ngày. Không có tiền bạc bị lãng phí cho hiệu năng không sử dụng.
Khả năng chính
1. Lập trình Agentic (Frontier-Bench v0.1)
Thông thường, khi bạn yêu cầu một mô hình "hãy viết một tính năng mới", nó sẽ viết mã và giao cho bạn. Opus 5 đi xa hơn - nó hỏi "liệu điều này có hoạt động không?" và tự chạy thử nghiệm, gỡ lỗi, và sửa chữa vấn đề.
Frontier-Bench v0.1 đo lường thế giới thực: đối mặt với các kho lưu trữ thực tế (Linux repos, codebases), mô hình phải thực hiện những thay đổi nhiều tệp, gỡ lỗi phức tạp, hoàn thành các tính năng. Opus 5 đạt 43.3% - gấp 2.3 lần Opus 4.8 (18.7%), vượt Fable 5 (33.7%), vượt GPT-5.6 Sol (34.4%).
Ví dụ từ Anthropic: "Máy chữ (FreeCAD) được vẽ từ ảnh. Không có quyền truy cập trực tiếp vào ảnh - Opus 5 viết một quy trình thị giác máy tính của riêng nó, chiết xuất hình học, xây dựng lại mô hình 3D thành công. Các mô hình khác thất bại 5 lần."
2. Giải quyết vấn đề mới (ARC-AGI 3)
ARC-AGI 3 là bài kiểm tra "loại bỏ" - AI được đặt vào môi trường tương tác mà không có hướng dẫn hoặc quy tắc cụ thể. Nó phải học thông qua thử và sai.
Kết quả của Opus 5: 30.2% - khoảng cách 4 lần so với GPT-5.6 Sol (7.8%), 20 lần so với Opus 4.8 (1.5%). Ngành công nghiệp dự không ai đạt được con số này trên ARC-AGI 3. Bất ngờ này cho thấy Opus 5 không chỉ là "nhanh hơn" - nó có một cách suy nghĩ khác biệt cơ bản về các vấn đề chưa từng thấy trước đây.
3. Tự kiểm tra (Self-Verification)
Tính năng mới: Opus 5 tự động kiểm tra công việc của mình. Trong lịch sử, các mô hình cần bạn nói "kiểm tra này" hoặc "sửa điều đó". Opus 5 tưởng tượng ra những sai lầm trước khi bạn nhận ra, và sửa chữa mà không bị nhắc nhở.
Trích dẫn từ Tako (công ty xử lý hồ sơ): "Nó kiểm tra công việc của nó giống như một lập trình viên frontend thực thụ." Một khách hàng từ Ultima (genomics) nói: "Nó hoạt động giống như một nhà khoa học cẩn thận hơn - tìm các bài kiểm tra thống kê phù hợp, kiểm tra lại kết quả."
4. Tính năng Effort Dial (Độ sâu suy luận)
Opus 5 có extended thinking (mặc định kích hoạt), nhưng bạn có thể điều chỉnh:
- low/medium: Tư duy cơ bản - tốc độ cao, chi phí thấp, phù hợp với nhiệm vụ thường ngày.
- high/max: Tư duy sâu - chi phí cao hơn, nhưng Opus 5 suy nghĩ dài hơn, phù hợp với bài toán phức tạp.
Với effort dial, một công ty xử lý tài liệu có thể chuyển routing thành low-effort cho tóm tắt hóa đơn (chi phí rẻ), nhưng high-effort cho hợp đồng phức tạp (suy luận sâu). Tổng chi phí giảm xuống, hiệu năng vẫn cao.
5. Computer Use - Vượt Fable 5 ở 1/3 Giá
Opus 5 có thể điều khiển máy tính của bạn: mở trình duyệt, nhấp vào nút, điền biểu mẫu, đọc dữ liệu trên màn hình. Trên OSWorld 2.0 (benchmark tương tác thực), Opus 5 đạt 70.57% (cao hơn bất kỳ phiên bản Opus trước đó) - và vượt Fable 5 với chi phí chỉ 1/3.
Zapier AutomationBench (quy trình churn-prevention đa bước): Opus 5 hoàn thành 100% end-to-end. Các mô hình trước đó không hoàn thành ngay cả với các kế hoạch phức tạp.
Bảng so sánh Benchmark
Dưới đây là so sánh hoàn chỉnh trên các benchmark nổi bật:
| Benchmark | Opus 5 | Fable 5 | GPT-5.6 Sol | Opus 4.8 | Loại đo lường |
|---|---|---|---|---|---|
| Frontier-Bench v0.1 (Lập trình agentic thực tế) | 43.3% | 33.7% | 34.4% | 18.7% | Multi-file refactor, debug, feature build |
| ARC-AGI 3 (Giải quyết vấn đề mới) | 30.2% | N/A | 7.8% | 1.5% | Interactive puzzle, trial-and-error learning |
| GDPval-AA v2 (Công việc tri thức, Elo điểm con người) | 1,861 | 1,747 | 1,736 | N/A | Chuyên môn, lập luận, tóm tắt |
| SWE-Bench Pro (Lập trình khó nhất từ real-world repos) | 79.2% | 80.0% | 64.6% | 69.2% | Pull requests thực tế, chỉnh sửa phức tạp |
| OSWorld 2.0 (Computer use - tương tác thực) | 70.57% | < 70% | N/A | 55.7% | Web form, file operation, multi-step UI |
| AutomationBench (Quy trình Zapier đa bước) | 26.0% (100% end-to-end churn workflow) | 17.4% | N/A | 17.0% | Automation sequences, conditionals, error handling |
Nhận xét: Opus 5 thắng rõ ràng trên lập trình agentic (Frontier-Bench) và giải quyết vấn đề mới (ARC-AGI 3). Trên SWE-Bench Pro, Fable 5 nhỉnh hơn xíu (80% vs 79.2%), nhưng sai số không đáng kể - Opus 5 với nửa giá là lựa chọn rõ ràng cho hầu hết công ty. Opus 5 cũng vượt mặt Fable 5 về computer use ở mức giá rẻ hơn.
So sánh chi tiết
Opus 5 vs Opus 4.8 (Người tiền nhiệm)
- Giá giống hệt: $5/$25 per M tokens - bạn không phải trả thêm tiền cho hiệu năng tăng gấp đôi.
- Hiệu năng: Gấp đôi hoặc hơn trên hầu hết benchmark (Frontier-Bench 2.3x, ARC-AGI 3 gấp 20x).
- Hành vi: Opus 4.8 cần bạn "hãy kiểm tra lại". Opus 5 tự kiểm tra. Opus 4.8 không có effort dial - Opus 5 có, tiết kiệm chi phí.
- Khoa học: Opus 5 tốt hơn 10.2% trên hóa học hữu cơ, 7.7% trên tác vụ protein. Đó là những gì một nhà khoa học cần.
Opus 5 vs Fable 5 (Flagship hiện tại)
- Giá: $5/$25 (Opus 5) vs $10/$50 (Fable 5) - Opus 5 rẻ bằng nửa.
- Hiệu năng: Opus 5 VƯỢT Fable 5 trên Frontier-Bench, ARC-AGI 3, GDPval-AA v2. Trên SWE-Bench Pro, Fable 5 nhỉnh hơn 0.8%, nhưng không đủ để biện minh cho gấp đôi giá.
- Khi nào chọn Fable 5: Nếu bạn cần agent chạy liên tục (đa ngày) mà không có tương tác người, hoặc bạn làm cybersecurity công khai (Fable 5 được perf hơn). Nhưng hầu hết công ty sẽ chọn Opus 5.
- Hạn chế ít hơn: Opus 5 có safety classifiers kích hoạt 85% ít hơn Fable 5. Nếu bạn làm công việc hợp pháp nhưng tinh tế (ví dụ: security audit), Opus 5 sẽ ít bị chặn.
- Giữ lại dữ liệu: Fable 5 bắt buộc giữ lại dữ liệu 30 ngày. Opus 5 không. Nếu bạn làm việc với tài liệu nhạy cảm (HIPAA, PII), Opus 5 là lựa chọn tuân thủ.
Opus 5 vs GPT-5.6 Sol (OpenAI)
- Frontier-Bench: Opus 5 43.3% vs Sol 34.4% (gần 30% cải tiến).
- ARC-AGI 3: Opus 5 30.2% vs Sol 7.8% (Opus 5 gấp 4 lần).
- Công việc tri thức: Opus 5 1,861 Elo vs Sol 1,736 (Opus 5 thắng rõ).
- SWE-Bench Pro: Opus 5 79.2% vs Sol 64.6% (Opus 5 hơn 14.6 điểm).
- Giá: Opus 5 rẻ hơn hoặc cạnh tranh tùy từng loại công việc.
Ai nên sử dụng ngay?
Kỹ sư phần mềm và nhóm DevOps: Frontier-Bench 43.3% nghĩa là Opus 5 có thể giải quyết những refactor phức tạp mà bạn thường phải xử lý thủ công. Nó tự kiểm tra, catch bugs trước deploy.
Nhà khoa học dữ liệu và sinh học: Tại Ultima Genomics, Opus 5 "hoạt động như một nhà khoa học cẩn thận hơn." Nếu bạn làm nghiên cứu, Opus 5 sẽ chạy các bài kiểm tra thống kê đúng, cross-check kết quả, và báo cáo có độ tin cậy cao hơn.
Công ty xử lý tài liệu và hợp pháp: Opus 5 vượt trội ở công việc tri thức (GDPval-AA v2: 1,861 Elo). Với effort dial, bạn có thể low-effort cho hóa đơn (chi phí thấp), high-effort cho hợp đồng (độ chính xác cao). Không có dữ liệu lưu lại 30 ngày = phù hợp với HIPAA, PII policy.
Nhóm tự động hóa (RPA, Zapier): Opus 5 đạt 100% end-to-end trên quy trình churn-prevention của Zapier. Nếu bạn xây dựng workflow, Opus 5 cần ít sửa chữa.
Startup/SMB với budget hạn chế: Giá Opus 5 = Opus 4.8, hiệu năng gần Fable 5. Tức là bạn không cần chọn giữa chi phí và hiệu năng - bạn có cả hai.
Giá và khả dụng
Pricing:
- Standard: $5 input / $25 output per M tokens (giống Opus 4.8).
- Fast Mode: $10/$50 per M tokens (~2.5x tốc độ, gấp đôi giá, vẫn rẻ hơn Fable 5 standard).
Context & Output:
- 1M token context window (max, cả default lẫn max lớp).
- 128K token max output (standard), 300K via Message Batches API.
Khả dụng (24/7/2026):
- Nền tảng: Claude.ai, Claude API (`claude-opus-5`), Claude Code, Claude Cowork, Amazon Bedrock, Google Cloud, Microsoft Foundry.
- Subscription: Mặc định trên Claude Max, mạnh nhất trên Claude Pro.
- Chương trình Cyber Verification: Các doanh nghiệp/nhà nghiên cứu có thể yêu cầu phiên bản ít giới hạn hơn cho công việc cybersecurity phòng thủ.
Hạn chế và lưu ý
Khi nào NÊN dùng Fable 5:
- Agent chạy liên tục 24/7 (Fable 5 được tuned cho quy trình đa ngày).
- SWE-Bench Pro tối ưu (Fable 5 80.0% vs Opus 5 79.2% - nhỏ nhưng nếu bạn cần tuyệt đối chính xác).
- Cybersecurity công khai (Mythos 5 thực tế tốt hơn, nhưng Fable 5 chấp nhận được).
- Bạn sẵn sàng trả 2x giá cho frontier absolutely guaranteed.
Hạn chế kỹ thuật:
- Extended thinking: Mặc định kích hoạt, nhưng KHÔNG thể tắt ở effort=max. Nếu bạn cố gắng tắt thinking ở max effort, API trả 400 error.
- XML tag leakage: Hiếm gặp nhưng khi thinking bị tắt (effort thấp), tag suy luận bên trong đôi khi lọt ra trong output. Không gây hại, nhưng cần clean.
- Verbosity: Opus 5 verbose hơn Opus 4.8 - cần hướng dẫn "be concise" rõ ràng để tránh lãng phí token.
- Over-verification: Vì nó tự kiểm tra, yêu cầu "verify this" thêm sẽ gây lãng phí token - hãy để nó tự verify.
Tiến trình và tiêu chí tiếp theo
Hôm nay (24/7/2026): Opus 5 phát hành đầy đủ.
Tháng 6 2026: Tối thiểu 4 mô hình trong 8 tuần (Mythos 5, Fable 5, Sonnet 5, Opus 5).
Sắp tới:
- Haiku 5: Cuối cùng từ dòng Haiku chưa có phiên bản 5 - chắc sẽ tới trong tháng 8.
- Fable 5.1 (đồn đoán): Cộng đồng dự đoán tháng 8 với những cải tiến mô phỏng (reinforcement learning) tương tự Opus 5.
- Mở rộng Fast Mode: Hiện tại trên Opus 5, có thể sắp áp dụng cho Sonnet/Haiku.
Chiến thắng trong tháng 7 của Anthropic: không chỉ là "mô hình mới", mà là làm sáng tỏ bản đồ giá trị. Bạn không còn cần đoán đoán "Fable 5 có xứng đáng giá 2x không?" - Opus 5 nói rõ ràng: hầu hết công ty sẽ tìm thấy Opus 5 đủ mạnh, với chi phí chỉ là một phần ba. Nếu bạn thực sự cần tuyệt đối frontier, chọn Fable 5. Nhưng nhanh chóng sẽ là trường hợp hiếm.
Để tìm hiểu thêm: via Bài thông báo chính thức từ Anthropic
Đạo hữu là phàm nhân, tu tiên giả
... hay AI cào nội dung?
Tất cả nội dung tại đạo quán đều miễn phí. Đạo hữu chỉ cần nhập email của mình để đọc tiếp. Nói KHÔNG với Spam. Huỷ subcribe lúc nào đạo hữu thích.
nếu không muốn nhận newsletter thì có thể nhập mail phụ
