- SWE-EVO đẩy coding agent từ bugfix đơn lẻ sang software evolution dài hơi: 7 repo Python, 48 tasks, trung bình 21 file và 874 test mỗi instance.
- Bản v6 trên arXiv cho thấy model mạnh nhất chỉ đạt 25% resolved rate trên SWE-EVO, trong khi cùng họ model có thể lên tới 72.80% trên SWE-Bench Verified.
- Paper cũng thêm Fix Rate để đo tiến bộ một phần.
TL;DR
- SWE-EVO là benchmark cho coding agent trong bài toán software evolution dài hơi, không phải chỉ sửa một bug riêng lẻ.
- Paper dùng 7 project Python mã nguồn mở trưởng thành, tạo ra 48 release-sized tasks, trung bình 21 file bị chỉnh sửa mỗi task và 874 test mỗi instance.
- Trong bảng chính của bản v6, model mạnh nhất đạt 25% resolved rate trên SWE-EVO; cùng model đó có thể đạt tới 72.80% trên SWE-Bench Verified. Đây là khoảng cách rất lớn.
- Paper không chỉ báo cáo resolved rate, mà còn thêm Fix Rate để đo tiến bộ một phần trên task dài hơi.
- Với coding agent, đây là benchmark thực tế hơn vì nó buộc phải hiểu release notes, phối hợp nhiều file, và giữ test suite lớn xanh qua nhiều vòng thay đổi.
Benchmark snapshot
Bảng này là phần quan trọng nhất để hiểu tại sao SWE-EVO khác các benchmark sửa bug thông thường. Số liệu là từ Table 1 trong paper.
| Metric | Mean | Max | Ý nghĩa |
|---|---|---|---|
| Issue text length | 2390.5 words | 22344 words | Spec dài hơn hẳn issue truyền thống |
| Codebase files | 363 | 1046 | Repo đủ lớn để multi-file coordination trở thành bài toán thật |
| Codebase lines | 78K | 272K | Không còn là task nhỏ có thể sửa cục bộ |
| Gold patch lines edited | 610.5 | 4113 | Patch scope rộng, không phải một diff ngắn |
| Gold patch files edited | 20.9 | 105 | Trung bình phải đụng gần 21 file cho một task |
| Gold patch functions edited | 51.0 | 379 | Thay đổi xuyên qua nhiều abstraction layer |
| FAIL_TO_PASS tests | 81.4 | 2774 | Rất nhiều hành vi mới cần được sửa cho đúng |
| Total tests | 874.0 | 8552 | Regression surface lớn, nên Fix Rate mới hữu ích |
Scale chart
Nếu muốn một hình dung nhanh về độ lớn của SWE-EVO, đây là bản tóm tắt dạng chart từ Table 1 và Figure 4.
Issue length Mean 2390.5 words ████████████████████
Patch scope Mean 20.9 files ███████████████████
Fail-to-pass Mean 81.4 tests █████████████████████████████
Total tests Mean 874.0 tests ██████████████████████████████████████████████
Thông điệp: SWE-EVO không chỉ dài hơn một chút. Nó nặng hơn đồng thời ở spec length, patch scope, và test surface.
Main leaderboard
Đây là Table 2 của paper v6. Cột đầu là kết quả trên SWE-EVO với OpenHands, cột tiếp theo là SWE-EVO với SWE-agent, và cột cuối là SWE-Bench Verified để so sánh.
| Model | OpenHands Resolved | OpenHands Apply | SWE-agent Resolved | SWE-agent Apply | SWE-Bench Verified |
|---|---|---|---|---|---|
| gpt-5.4 | 25.00 | 97.92 | 25.00 | 97.92 | - |
| gpt-5.2 | 18.75 | 100 | 22.92 | 97.92 | 72.80 |
| gpt-5-08-07 | 18.75 | 100 | 20.83 | 100 | 65.00 |
| gpt-5-mini-08-07 | 10.42 | 97.92 | 10.42 | 100 | 59.80 |
| gpt-5-nano-08-07 | 4.17 | 85.42 | 4.17 | 100 | 34.80 |
| o3-2025-04-16 | 4.17 | 93.75 | 6.25 | 100 | 58.40 |
| gpt-4.1-2025-04-14 | 2.08 | 87.50 | 10.42 | 97.92 | 39.58 |
| gpt-4o-2024-11-20 | 6.25 | 97.92 | 6.25 | 100 | 21.62 |
| gpt-oss-120b | 2.08 | 100 | 6.25 | 100 | 26.00 |
| deepseek-v3p2 | 20.83 | 95.83 | 23.40 | 95.83 | 70.00 |
| deepseek-v3p1 | 16.67 | 97.92 | 10.42 | 100 | - |
| deepseek-r1-0528 | 10.42 | 100 | 8.33 | 100 | 57.60 |
| glm-5 | 8.33 | 97.92 | 37.50 | 100 | 72.80 |
| glm-4p7 | 4.17 | 100 | 39.58 | 97.92 | - |
| glm-4p5 | 16.67 | 97.92 | 16.67 | 100 | 54.20 |
| qwen3-coder-480b-a35b | 14.58 | 97.92 | 14.58 | 97.92 | 55.40 |
| kimi-k2p5 | 22.92 | 97.92 | 25.00 | 97.92 | 70.80 |
| kimi-k2-instruct | 16.67 | 100 | 18.75 | 100 | 43.80 |
Hai điểm đáng chú ý nhất ở bảng này:
- Model mạnh nhất trên SWE-EVO chỉ đạt 25%, trong khi SWE-Bench Verified của một số model cùng họ cao hơn rất nhiều.
- Scaffold sensitivity có thật: cùng một model family, OpenHands và SWE-agent có thể lệch nhau đáng kể.
Resolved-rate chart
Đây là chart rút gọn từ cột Average Resolved trong Table 6. Nó giúp nhìn nhanh thứ tự mạnh/yếu tương đối của các model trên SWE-EVO.
gpt-5.4 25.00% █████████████████████████
kimi-k2p5 23.96% ████████████████████████
deepseek-v3p2 22.12% ██████████████████████
glm-5 22.92% ███████████████████████
gpt-5.2 20.84% █████████████████████
gpt-5-08-07 19.79% ████████████████████
deepseek-v3p1 13.55% ██████████████
qwen3-coder-480b 14.58% ███████████████
gpt-5-mini 10.42% ██████████
gpt-5-nano 4.17% ████
Release-note only vs PR/issue context
Paper còn kiểm tra setting khó hơn: chỉ đưa release note, không đưa PR/issue context. Kết quả cho thấy thêm context giúp ích thật, nhưng không đủ để giải quyết bản chất bài toán.
| Model | Release-note only OpenHands | Release-note only SWE-agent | + PR/issue OpenHands | + PR/issue SWE-agent |
|---|---|---|---|---|
| gpt-5-08-07 | 14.58 | 16.67 | 18.75 | 20.83 |
| gpt-5-mini-08-07 | 8.33 | 10.42 | 10.42 | 10.42 |
| o3-2025-04-16 | 4.17 | 6.25 | 4.17 | 6.25 |
| gpt-4.1-2025-04-14 | 2.08 | 8.33 | 2.08 | 10.42 |
| gpt-4o-2024-11-20 | 8.33 | 4.17 | 6.25 | 6.25 |
| gpt-oss-120b | 0.00 | 0.00 | 2.08 | 6.25 |
| deepseek-r1-0528 | 10.42 | 6.25 | 10.42 | 8.33 |
| glm-4p5 | 6.25 | 12.50 | 16.67 | 16.67 |
| qwen3-coder-480b-a35b | 14.58 | 12.50 | 14.58 | 14.58 |
| kimi-k2-instruct | 8.33 | 12.50 | 16.67 | 18.75 |
Fix Rate table
Fix Rate là điểm đáng giá nhất về mặt measurement. Nó giữ được tín hiệu tiến bộ một phần trên task dài, nơi resolved rate binary dễ che mất rất nhiều thông tin.
| Model | OpenHands Resolved | OpenHands Fix | SWE-agent Resolved | SWE-agent Fix | Average Resolved | Average Fix |
|---|---|---|---|---|---|---|
| gpt-5.4 | 25.00 | 33.89 | 25.00 | 33.98 | 25.00 | 33.96 |
| gpt-5.2 | 18.75 | 23.43 | 22.92 | 30.21 | 20.84 | 26.82 |
| gpt-5-08-07 | 18.75 | 27.64 | 20.83 | 31.46 | 19.79 | 29.55 |
| gpt-5-mini-08-07 | 10.42 | 17.48 | 10.42 | 17.48 | 10.42 | 17.48 |
| gpt-5-nano-08-07 | 4.17 | 5.99 | 4.17 | 5.26 | 4.17 | 5.63 |
| o3-2025-04-16 | 4.17 | 6.47 | 4.17 | 13.72 | 4.17 | 10.10 |
| gpt-4.1-2025-04-14 | 2.08 | 4.65 | 10.42 | 14.79 | 6.25 | 9.72 |
| gpt-4o-2024-11-20 | 6.25 | 7.77 | 6.25 | 10.15 | 6.25 | 8.96 |
| gpt-oss-120b | 2.08 | 2.08 | 6.25 | 7.88 | 4.17 | 4.98 |
| deepseek-v3p2 | 20.83 | 26.89 | 23.40 | 31.41 | 22.12 | 29.15 |
| deepseek-v3p1 | 16.67 | 21.83 | 10.42 | 15.51 | 13.55 | 18.67 |
| deepseek-r1-0528 | 10.42 | 14.31 | 8.33 | 9.89 | 9.38 | 12.10 |
| glm-5 | 8.33 | 9.67 | 37.50 | 44.27 | 22.92 | 27.45 |
| glm-4p7 | 4.17 | 5.19 | 39.58 | 45.87 | 21.88 | 25.53 |
| glm-4p5 | 16.67 | 23.74 | 16.67 | 26.55 | 16.67 | 25.15 |
| qwen3-coder-480b-a35b | 14.58 | 19.56 | 14.58 | 23.74 | 14.58 | 21.65 |
| kimi-k2p5 | 22.92 | 27.75 | 25.00 | 32.91 | 23.96 | 30.33 |
| kimi-k2-instruct | 16.67 | 22.42 | 18.75 | 24.03 | 17.71 | 23.23 |
Điều các con số này nói lên
- SWE-EVO đo một lớp năng lực khác: không còn là sửa một issue riêng lẻ, mà là giữ cho một codebase tiến hóa đúng qua nhiều vòng thay đổi.
- Khoảng cách giữa resolved rate và fix rate cho thấy binary pass/fail không đủ để phản ánh tiến bộ thực sự trong task dài.
- Thêm PR/issue context có giúp, nhưng không cứu được bản chất khó của bài toán.
- Scaffold sensitivity đáng chú ý: cùng model, kết quả giữa OpenHands và SWE-agent có thể khác nhau đáng kể.
Kết
SWE-EVO đáng đọc vì nó dịch benchmark coding agent từ một bài toán cục bộ sang một bài toán dài hơi, gần production hơn. Nếu bạn đang build agent để chạy trên repo thật, phần cần chú ý nhất không phải chỉ là resolved rate cuối cùng, mà là toàn bộ bề mặt đánh giá: độ lớn của spec, số file bị đụng, test surface, khả năng giữ tiến bộ một phần, và độ nhạy với scaffold.
via arXiv 2512.18470 và arXiv HTML v6
Đạo hữu là phàm nhân, tu tiên giả
... hay AI cào nội dung?
Tất cả nội dung tại đạo quán đều miễn phí. Đạo hữu chỉ cần nhập email của mình để đọc tiếp. Nói KHÔNG với Spam. Huỷ subcribe lúc nào đạo hữu thích.
nếu không muốn nhận newsletter thì có thể nhập mail phụ
