A benchmark focusing on various software stacks and vendors to build modern applications.
| Model | Agent | Passed | Avg Duration | Success Rate |
|---|---|---|---|---|
| #1 gpt-5.5NEW | Pochi | 3 | 529.8s | 100% |
| #2 claude-4-6-sonnet | Pochi | 248 | 348.5s | 75% |
| #3 gemini-3-flash | Pochi | 114 | 378.1s | 75% |
| #4 gpt-5.4 | Pochi | 20 | 193.6s | 74% |
| #5 gemini-3.1-pro | Pochi | 173 | 283.9s | 71% |
| #6 MiniMax-M3 | Pochi | 278 | 757.2s | 71% |
| #7 MiniMax-M3 | Terminus-2 | 210 | 805.4s | 70% |
| #8 claude-4-7-opus | Pochi | 31 | 292.1s | 69% |
| #9 gemini-3.5-flash | Pochi | 583 | 758.2s | 68% |
| #10 claude-5-sonnet | Pochi | 104 | 748.3s | 67% |
| #11 gpt-5.2-codex | Pochi | 75 | 194.0s | 62% |
| #12 glm-5.2 | Pochi | 259 | 801.4s | 58% |
| #13 deepseek-4-pro | Pochi | 68 | 686.9s | 35% |
| #14 glm-4.7 | Pochi | 0 | 466.2s | 0% |