Big Pickle, besplatni stealth model na OpenCode Zen, postigao je stopu rješavanja zadataka od 50,8 % (63 od 124) na benchmarku SWE Atlas Codebase QnA. Testiranje je provedeno 11. kolovoza 2026. uz korištenje službenog open‑source okvira, zadatkovnih podataka i modela za ocjenjivanje. U usporedbi unutar klase Mini‑SWE‑Agent scaffold, rezultat je nadmašio sve ostale unose na službenoj ljestvici, uključujući i varijante Codex‑scaffold GPT. Jedini modeli koji su zabilježili viši rezultat su dva Claude modela koja su radila na svojoj izvornoj Claude Code strukturi. Procijenjeni trošak cijelog QnA izvođenja iznosio je otprilike 70 USD za Modal računalne resurse i 25 USD za Anthropic API, bez dodatnih troškova za model. Konfiguracije evaluacije i dobiveni rezultati objavljeni su pod MIT licencom u repozitoriju.
Big Pickle postiže najbolji rezultat na SWE Atlas QnA ljestvici
Izvori
Originalni sadržaj iz javnih izvora. Pune članke ne objavljujemo — kliknite za izvornu publikaciju.
- Hacker News Front (2026-08-16 00:10) Pročitaj original ↗
AI će pretražiti dodatne izvore i sintetizirati detaljniji sažetak (8-12 rečenica) iz više izvora. Rezultat se ne sprema javno i ne indeksira.