Siirry sisältöön

mitattua

Tutkimus

Tutkimuksia omasta työstäni, julkaistuna lukujen kanssa. Uusin ensin. Jokaisesta saa PDF:n mukaansa, ja yksi niistä peruu aiemman löydökseni.

  1. Do the cheap agents pay for themselves? Seven delegations, measured

    maksavatko halvat agentit itsensä takaisin: seitsemän mitattua delegointia yhdestä istunnosta; 3 seitsemästä huomasi jotain, minkä olisin itse jättänyt huomaamatta, 1 oli väärä löydös, eikä säästöä väitetä, koska vertailukohtaa ei voi mitata

    Lue PDF · 142 KB

  2. The translation audit: a local model re-reads my Finnish

    käännösauditointi: paikallinen suomen kielen malli lukee sivuston kaikki 396 suomenkielistä merkkijonoa englanninkielistä lähdettä vasten; sen 276 ehdotetusta muutoksesta vain 2 kesti

    Tietoa PDF · 180 KB

  3. Poro-2-8B in production: what we measured, what broke, what we built around it

    Poro-2-8B tuotannossa: mitä kaksi projektia mittasi, miksi toinen otti sen käyttöön ja toinen ei, sekä sen ympärille rakennettu deterministinen kerros

    Lue PDF · 129 KB

  4. Which local model writes the best Finnish? A blind test settles it

    sokkotesti: äidinkielinen puhuja arvioi sokkona 3 paikallista mallia suomen luonnollisuudessa; Poro voittaa 26/30

    Tietoa PDF · 228 KB

  5. How a Finnish-RAG experiment caught and corrected its own mistake

    rag suomi -tutkimus, menetelmä: miten koe huomasi ja korjasi oman virheensä; prosessi, ei löydökset

    Lue PDF · 128 KB

  6. Does the portfolio RAG need Finnish, and does it need a Finnish-built model?

    rag suomi -koe: 3 paikallista 8B-mallia suomen synteesistä vs hallinnasta, yksittäismuuttuja, €0

    Tietoa PDF · 265 KB

  7. Skill-suite calibration: 96 A/B arms across three codebases and three models

    uusin + laajin: 16 skilliä, kylmä-vs-skilli A/B kolmella mallilla; nykyinen tilannekuva

    Lue PDF · 424 KB

  8. The two skill-auditors: what they cost, and what they fixed

    synteesi: mitä kaksi skilliauditoijaa maksoivat (~36 % halvempi ajaa) ja mitkä ansat ne paljastivat

    Lue PDF · 234 KB

  9. Round 6 of the skills optimization study: re-measuring the six noisiest cells

    kierros 6 · meluisimmat solut mitattu uudelleen syvemmin: N=1-sattuma kumottu, ~+76 % vahvistettu

    Lue PDF · 140 KB

  10. Why "read each SKILL.md" costs tokens: five rounds of before/after testing

    optimointi: 5 kierrosta ennen/jälkeen yhdellä SKILL.md:llä; 3 kustannusansaa löydetty + korjattu

    Lue PDF · 352 KB

  11. The skill catalog: every skill across four repositories

    jokainen skilli kaikista 4 reposta: inventaario, kustannukset mitattu (ei arvattu)

    Tietoa PDF · 375 KB