Prepis amharskej reči do textu, teraz v Gaston
Náš vlastný model na prepis amharskej reči do textu, dotrénovaný na približne 1 060 hodinách amharskej reči. Rozhovory, vysielanie aj bežné konverzácie premení na prehľadávateľný text v etiópskom písme, s časovou značkou pri každom slove.
Chybovosť slov (WER) počíta slová, ktoré sa líšia od starostlivého ľudského prepisu. Nižšia hodnota je lepšia.
Najnižšia chybovosť slov spomedzi otvorene licencovaných amharských modelov
Každý model sme hodnotili na sade Horn-ASR: 774 nahrávok skutočných rozhovorov zo siedmich nárečí. Je to naša najnáročnejšia testovacia sada a nikdy sme ju nepoužili na trénovanie.
Náš náskok pred hohe-asr nie je náhoda: s 95 % istotou je naša chybovosť nižšia o 0,6 až 1,9 percentuálneho bodu.
* Merané skôr na celých nahrávkach namiesto krátkych úsekov. Pri týchto typoch modelov to výsledky nemení, tieto čísla však berte ako orientačné.
Približne polovica chýb v slovách oproti najlepšiemu modelu OpenAI
Model gpt-transcribe od OpenAI sme otestovali na presne tých istých nahrávkach s rovnakým hodnotením. Pri hovorenej konverzácii, čítanej reči aj opisoch robí náš model približne o polovicu menej chýb.
Rozdiel platí pre každé nárečie. Napríklad Gojjam 33,7 % oproti 62,3 % a Wollo 34,0 % oproti 62,9 %.
Testované v októbri 2026 na 1 774 verejných testovacích nahrávkach (približne 6,5 hodiny). 95 % intervaly spoľahlivosti pre rozdiel: 25 až 27 bodov (Horn-ASR), 26 až 29 (Dataset.ET), 23 až 26 (WAXAL). Model gpt-transcribe dostal v prompte informáciu, že zvuk je v amharčine. Výsledky WAXAL sú tu bez filtra opakovaní, aby bolo porovnanie férové. Modely OpenAI sa časom menia.
Silný pri čítanej reči aj pri skutočnej konverzácii
| WER | CER | |
|---|---|---|
| Gaston Amharic | 30,7 | 12,9 |
| Náš predchádzajúci model | 32,7 | 13,9 |
| hohe-asr | 32,0 | 12,5 |
| WER | CER | |
|---|---|---|
| Gaston Amharic | 19,5 | 7,8 |
| Náš predchádzajúci model | 20,6 | 8,4 |
| hohe-asr | 22,2 | 8,3 |
| WER | CER | |
|---|---|---|
| Gaston Amharic | 21,7 | 8,9 |
| Náš predchádzajúci model | 22,1 | 8,9 |
| hohe-asr | 22,5 | 8,7 |
S filtrom opakovania, ktorý Gaston používa v produkcii. Bez neho: 22,7 % WER. Na tejto sade sme s hohe-asr nerozhodne, rozdiel je v rámci štatistickej chyby.
WER: chybovosť slov. CER: chybovosť znakov. Pri oboch je nižšia hodnota lepšia.
Stavaný na amharčinu, akou sa naozaj hovorí
Amharčina znie v Gojjame inak ako v Addis Abebe. Model prekonáva najlepší iný otvorený model v 6 zo 7 nárečových skupín a v Addis Abebe zaostáva o menej ako pol bodu.
Najväčšie zlepšenie oproti nášmu predchádzajúcemu modelu je vo Wollo, Gojjame a Shewe. Nahrávky gojjamského nárečia sme do trénovania pridali práve v tejto verzii.
● najnižšia chybovosť v skupine. Každá nárečová skupina má len 56 až 163 nahrávok, takže rozdiely menšie ako približne jeden bod sú v rámci šumu.
Z čoho vznikol
Vychádzali sme z modelu OpenAI Whisper large-v3 a dotrénovali ho na veľkej a rozmanitej zbierke amharskej reči: čítané vety, spontánne opisy, nárečové nahrávky v telefónnej kvalite a reč z YouTube.
Plus široký materiál od mnohých ďalších zdrojov a hovoriacich.
Približne 9 hodín syntetického ticha a šumu ho učí nevypísať nič namiesto vymýšľania textu.
Čo získate
Model beží priamo v službe Gaston, takže z každej amharskej nahrávky vznikne prepis, ktorý môžete prehľadávať, prekladať, ukladať do záložiek, exportovať a analyzovať s AI agentom.
- •Anglické prevzaté slová a názvy značiek
- •Občasné spojenie dvoch slov do jedného
- •Miešanie starého a nového zápisu niekoľkých písmen (ጕ/ጉ, ኵ/ኩ)
Ako sme merali
- Presne tak, ako model beží v produkčnej službe: zvuk rozdelený na úseky dlhé najviac 20 sekúnd, dekódovaný pomocou beam search 5.
- Pravopisné varianty písmen, ktoré znejú rovnako, sa nepočítajú ako chyby, napríklad: ሀ/ሐ/ኀ, ሰ/ሠ
- Horn-ASR sme nikdy nepoužili na trénovanie, ale pomohol nám vybrať najlepší checkpoint, preto je jeho výsledok veľmi mierne optimistický. Ďalšie dve testovacie sady sme nepoužili na žiadne rozhodnutie.
| Testovacia sada | Použitá veľkosť | Poznámky |
|---|---|---|
Horn-ASR LesanAI · CC-BY-SA-4.0 |
774 nahrávok do 30 s (~2,5 h) | Spontánne rozhovory, nikdy nepoužité na trénovanie |
Dataset.ET snapwre/amharic-speech · CC-BY-4.0 |
Náhodná vzorka 500 nahrávok | Hovoriaci odlišní od jej trénovacej časti |
WAXAL Google WaxalNLP · CC-BY-SA-4.0 |
Náhodná vzorka 500 nahrávok | Hovoriaci odlišní od jej trénovacej časti |
Poďakovanie
Tento model by nevznikol bez otvorene licencovaných amharských rečových dát. Ďakujeme všetkým, ktorí ich vytvorili a zdieľali.
- Založené na OpenAI Whisper large-v3 (MIT)
- Amharic Linguistic Datasets © 2026 Leyu (gheero), CC BY 4.0 - nahrávky boli rozdelené a prefiltrované
- Google WaxalNLP (WAXAL), CC-BY-SA-4.0
- snapwre (Dataset.ET, amharic-speech), CC-BY-4.0
- Google FLEURS, CC-BY-4.0
- Mozilla Common Voice, CC0
- Ejigu, Y. A. (2024), BDU-speech
- ESPnet YODAS2, CC-BY-3.0
- snapwre/hohe-asr-amharic, CC-BY-4.0 (učiteľský model, nie je súčasťou produktu)
- MUSAN corpus (hluk v pozadí)
- LesanAI Horn-ASR, CC-BY-SA-4.0 (len na testovanie)
Vyskúšajte ho na vlastných amharských nahrávkach
Nahrajte súbor alebo vložte odkaz na YouTube a o zvyšok sa postará Gaston.
Vytvoriť účet