Näin saat Claudesta enemmän irti: Opus 5 on työjuhta
Tällä sivulla
Tekoälymalleissa on viime vuodet toistunut sama ärsyttävä kaava: mitä fiksumpi malli, sitä kalliimpi hinta. Ehdin juuri tehdä aiheesta videonkin. Sitten Anthropic julkaisi Claude Opus 5:n, ja kaava meni rikki.
Videolla olen siis väärässä. Tämä ala muuttuu niin nopeasti, että omia käsityksiä joutuu tarkistamaan vähän väliä.
Kiitos kuuluu ystävälleni Jarno Silanderille, joka vinkkasi, että Opus 5 kannattaa ottaa tosissaan päivittäiskäyttöön. En uskonut suoralta kädeltä, vaan luin system card -raportin ja dokumentaation, kävin läpi ensimmäiset arviot ja testasin mallia omissa töissäni. Tästä se tämä artikkeli syntyi.
Claude Opus 5 vs Fable 5: mitä luvut sanovat
Fable 5 on Anthropicin kyvykkäin malli, ja hintakin on sen mukainen: 10 dollaria miljoonalta input-tokenilta ja 50 dollaria miljoonalta output-tokenilta. Opus 5 maksaa tasan puolet, 5 ja 25 dollaria.
Yllättävää on, miten pieni ero malleilla lopulta on. Luvut ovat suoraan Opus 5:n system card -raportista:
| Benchmark | Opus 5 | Fable 5 |
|---|---|---|
| FrontierCode (agenttikoodaus) | 53,4 | 53,5 |
| Humanity’s Last Exam (ilman työkaluja) | 56,3 | 56,5 |
| BrowseComp (agenttihaku) | 90,8 | 87,4 |
| OSWorld 2.0 (tietokoneen käyttö) | 70,6 | 66,1 |
| FrontierBench v0.1 | 44,4 | 33,7 |
Taulukkoa kannattaa katsoa hetki: puolta halvempi malli vie kolme mittaria viidestä. Fable johtaa enää vaativimmassa pitkän aikavälin päättelyssä, eikä arkityössä eroa käytännössä huomaa.
Raportista löytyi toinenkin yllätys: parhaan FrontierCode-tuloksensa Opus 5 teki keskitason effort-asetuksella. (Effort määrää, kuinka paljon malli ajattelee ja tekee töitä yhtä vastausta kohden.) Anthropic itsekin kehottaa nykyään käyttämään low- ja medium-tasoja rohkeasti. Enempi ajattelu ei siis tällä mallilla automaattisesti paranna tulosta.
Kaaviosta kannattaa katsoa, missä oranssi viiva käy korkeimmillaan: Opus 5 pääsee medium-tasolla 53,4 prosenttiin noin neljän dollarin tehtäväkustannuksella. Fable 5 yltää 53,5 prosenttiin, mutta vaatii siihen xhigh-asetuksen ja noin 13 dollaria tehtävää kohden. Sama tulos syntyy siis kolminkertaisella hinnalla. (Kaavio: Anthropic, Claude Opus 5 system card, kuva 8.4.A.)
Näillä asetuksilla ajan Claudea nyt
Aiemmin ajoin kallista mallia halvoilla asetuksilla. Fable oli päämallini, effort oli käännetty alas, ja olin vielä rakentanut erillisen säännön, joka pakotti aliagentit halvempiin malleihin. Koko järjestelmä oli viritetty kiertämään Fablen hintaa.
Nyt teen näin:
- Opus 5 on päämalli. Claude Codessa vaihto tehdään settings.json-tiedostoon (
"model": "claude-opus-5") tai suoraan komennolla/model. Konteksti-ikkuna on sama miljoona tokenia kuin Fablessa, ilman lisähintaa. - Effortin lasken high-tasolta mediumiin, jos laatu kestää. Tämä on Anthropicin oma ohje: aloita oletusasetuksesta ja kokeile alaspäin omilla töilläsi. Minun arkisessioissani medium riittää, ja yllä olevassa koodibenchmarkissa se oli kirjaimellisesti paras tulos. Joka työkuormaan sama ei silti päde, joten testaa omallasi.
- Fable jäi varamalliksi. Se on edelleen käytössä silloin, kun sessio oikeasti vaatii kaiken tehon. Rutiinityöstä en vain enää maksa lippulaivahintaa.
- Purin aliagenttirajoitukset. Opuksen hinnoilla aliagentit voivat periä päämallin, joten kirjoittamani valvontasääntö jäi pitkälti eläkkeelle. Oli mukava päästä eroon yhdestä ylimääräisestä virityksestä.
- Ajastetut agentit pyörivät nekin halvemmalla mallilla. Tämä on isompi asia kuin äkkiä ajattelisi. Minulla pyörii noin viisi päivittäistä ja viisi viikoittaista ajastettua agenttia, ja ne kuluttavat tokeneita silloinkin, kun en ole koneella. Oletusmallin valinta kertautuu niihin kaikkiin.
Yksi varoitus ennen kuin kopioit asetukset: Opus 5 puhuu enemmän kuin edeltäjänsä ja delegoi töitä aliagenteille herkemmin, mikä voi huomaamatta syödä säästöt. Anthropic myöntää tämän itse ohjeistuksessaan, ja Lenny’s Newsletterin arviossa mallia kutsuttiin loistavaksi mutta ärsyttäväksi juuri tästä syystä. Kun pyydät tiivistä ulosantia ja rajoitat delegointia, säästöt pitävät.
Paljonko säästyy
Lasku on helppo, koska hintaero on tasan kaksinkertainen. Esimerkki omasta käytöstäni, noin 15 sessiota päivässä ja kussakin noin 200 000 tokenia (tyypillisellä 80/20-jaolla input- ja output-tokenien kesken):
| Fable 5 | Opus 5 | |
|---|---|---|
| Yksi 200k-sessio | 3,60 $ | 1,80 $ |
| 15 sessiota päivässä | 54 $ | 27 $ |
| Kuukausi | ~1 620 $ | ~810 $ |
Säästöä kertyy API-hinnoilla noin 810 dollaria kuussa, eikä laadusta tarvitse tinkiä. Tilauskäyttäjällä sama matematiikka näkyy niin, että käyttörajat riittävät suunnilleen tuplasti pidemmälle.
Välimuistialennukset ovat molemmissa malleissa samat, joten suhde ei niistä muutu.
Sama näkyy system cardissa myös tehtävätasolla. DeepSWE-benchmarkissa (pitkäkestoista koodausta) Opus 5 pääsee medium-tasolla 66,9 prosenttiin noin kolmen dollarin tehtäväkustannuksella. Fable 5 tarvitsee max-asetuksen ja yli 20 dollaria, jotta se yltää 69,7 prosenttiin. Oranssi käyrä kulkee koko matkan muiden yläpuolella ja vasemmalla:
(Kaavio: Anthropic, Claude Opus 5 system card, kuva 8.3.A.)
Miksi tämä on iso juttu muillekin kuin tehokäyttäjille
Jos tilauksessasi ei ole Fablea lainkaan, tämä on sinulle se varsinainen uutinen: työjuhtaluokan malli nousi käytännössä lippulaivan tasolle. Kakkosmalliin tyytyminen ei ole enää kompromissi, koska useassa agenttibenchmarkissa ajat nyt sitä parempaa mallia.
Ja jos ajat agentteja ajastettuna, tutkimusagentteja, raportointiagentteja tai mitä sinulla pyöriikin, oletusmallin hinta kertautuu joka ikinen päivä. Jatkossa kysyn jokaisen mallijulkaisun kohdalla saman kysymyksen: paljonko minun oma työkuormani maksaa tällä mallilla?
Hintakehityksestä olin siis väärässä. Harvoin väärässä oleminen on tuntunut näin hyvältä.
Usein kysytyt kysymykset
Kumpaa kannattaa käyttää, Claude Opus 5:tä vai Fable 5:tä?
Arkityöhön Opus 5:tä. Anthropicin oman system card -raportin mukaan se on koodibenchmarkeissa Fable 5:n tasolla (FrontierCode 53,4 vs 53,5) ja voittaa sen useassa agenttibenchmarkissa, vaikka maksaa puolet vähemmän. Fable 5 kannattaa pitää varalla vaativinta pitkän aikavälin työtä varten, jos tilauksesi sisältää sen.
Mitä Clauden effort-tasot ovat?
Effort on asetus (low, medium, high, xhigh, max), joka määrää, kuinka paljon malli ajattelee ja tekee töitä yhtä pyyntöä kohden. Mitä korkeampi taso, sitä enemmän tokeneita kuluu ja sitä kauemmin vastausta odottaa. Opus 5:ssä kiinnostavinta on, että FrontierCode-koodibenchmarkin paras tulos syntyi medium-tasolla. Korkeampi effort ei siis automaattisesti tarkoita parempaa tulosta.
Onko Claude Opus 5 halvempi ajaa kuin Fable 5?
On, tasan puolet halvempi: 5 dollaria miljoonalta input-tokenilta ja 25 dollaria miljoonalta output-tokenilta, kun Fable 5 maksaa 10 ja 50 dollaria. Suhde ei riipu työkuormasta, ja tilauskäytössä sama ero näkyy niin, että käyttörajat riittävät suunnilleen tuplasti pidemmälle.
Milloin Fable 5 on yhä hintansa arvoinen?
Vaativimmassa päättelyssä ja hyvin pitkissä autonomisissa ajoissa. Itse pidän sen varalla oikeasti vaikeita sessioita varten, en oletusmallina. Ja jos Fablea ei ole tilauksessasi lainkaan, ei hätää: Opus 5 medium-tasolla pärjää erinomaisesti.