Nový model na rozpoznávanie reči
አማርኛ

Prepis amharskej reči do textu, teraz v Gaston

Náš vlastný model na prepis amharskej reči do textu, dotrénovaný na približne 1 060 hodinách amharskej reči. Rozhovory, vysielanie aj bežné konverzácie premení na prehľadávateľný text v etiópskom písme, s časovou značkou pri každom slove.

30,7 %
chybovosť slov pri hovorenej konverzácii
19,5 %
chybovosť slov pri čítanej reči
~1 060 h
veľkosť datasetu
~9×
rýchlejšie ako v reálnom čase

Chybovosť slov (WER) počíta slová, ktoré sa líšia od starostlivého ľudského prepisu. Nižšia hodnota je lepšia.

01 · Porovnanie

Najnižšia chybovosť slov spomedzi otvorene licencovaných amharských modelov

Každý model sme hodnotili na sade Horn-ASR: 774 nahrávok skutočných rozhovorov zo siedmich nárečí. Je to naša najnáročnejšia testovacia sada a nikdy sme ju nepoužili na trénovanie.

Náš náskok pred hohe-asr nie je náhoda: s 95 % istotou je naša chybovosť nižšia o 0,6 až 1,9 percentuálneho bodu.

Horn-ASR, hovorená konverzácia
Nižšie je lepšie
Gaston Amharic Gaston
30,7 %
snapwre/hohe-asr-amharic CC-BY-4.0
32,0 %
badrex/Ethio-ASR-amharic CC-BY-4.0
47,0 %*
facebook/mms-1b-all CC-BY-NC
58,0 %*

* Merané skôr na celých nahrávkach namiesto krátkych úsekov. Pri týchto typoch modelov to výsledky nemení, tieto čísla však berte ako orientačné.

02 · V porovnaní s OpenAI

Približne polovica chýb v slovách oproti najlepšiemu modelu OpenAI

Model gpt-transcribe od OpenAI sme otestovali na presne tých istých nahrávkach s rovnakým hodnotením. Pri hovorenej konverzácii, čítanej reči aj opisoch robí náš model približne o polovicu menej chýb.

Rozdiel platí pre každé nárečie. Napríklad Gojjam 33,7 % oproti 62,3 % a Wollo 34,0 % oproti 62,9 %.

Chybovosť slov na troch verejných testovacích sadách
Nižšie je lepšie
Gaston Amharic OpenAI gpt-transcribe
Horn-ASR · Hovorená konverzácia
30,7 %
56,7 %
Dataset.ET · Čítané vety
19,5 %
46,6 %
WAXAL · Opisy obrázkov
22,7 %
47,1 %

Testované v októbri 2026 na 1 774 verejných testovacích nahrávkach (približne 6,5 hodiny). 95 % intervaly spoľahlivosti pre rozdiel: 25 až 27 bodov (Horn-ASR), 26 až 29 (Dataset.ET), 23 až 26 (WAXAL). Model gpt-transcribe dostal v prompte informáciu, že zvuk je v amharčine. Výsledky WAXAL sú tu bez filtra opakovaní, aby bolo porovnanie férové. Modely OpenAI sa časom menia.

03 · Presnosť

Silný pri čítanej reči aj pri skutočnej konverzácii

Horn-ASR
Spontánne rozhovory, 7 nárečových skupín
30,7 %
WER
12,9 %
CER
WER CER
Gaston Amharic 30,7 12,9
Náš predchádzajúci model 32,7 13,9
hohe-asr 32,0 12,5
Dataset.ET
Čítané vety
19,5 %
WER
7,8 %
CER
WER CER
Gaston Amharic 19,5 7,8
Náš predchádzajúci model 20,6 8,4
hohe-asr 22,2 8,3
WAXAL
Opisy obrázkov
21,7 %
WER
8,9 %
CER
WER CER
Gaston Amharic 21,7 8,9
Náš predchádzajúci model 22,1 8,9
hohe-asr 22,5 8,7

S filtrom opakovania, ktorý Gaston používa v produkcii. Bez neho: 22,7 % WER. Na tejto sade sme s hohe-asr nerozhodne, rozdiel je v rámci štatistickej chyby.

Kde zatiaľ nevedieme
V chybovosti znakov je hohe-asr stále mierne lepší pri konverzačnom zvuku (12,5 % oproti 12,9 %) a na sade WAXAL. Náš náskok je v celých slovách, a práve tie si čitatelia všimnú.

WER: chybovosť slov. CER: chybovosť znakov. Pri oboch je nižšia hodnota lepšia.

04 · Nárečia

Stavaný na amharčinu, akou sa naozaj hovorí

Amharčina znie v Gojjame inak ako v Addis Abebe. Model prekonáva najlepší iný otvorený model v 6 zo 7 nárečových skupín a v Addis Abebe zaostáva o menej ako pol bodu.

Najväčšie zlepšenie oproti nášmu predchádzajúcemu modelu je vo Wollo, Gojjame a Shewe. Nahrávky gojjamského nárečia sme do trénovania pridali práve v tejto verzii.

Gaston Amharic Náš predchádzajúci model hohe-asr
Chybovosť slov na Horn-ASR podľa nárečovej skupiny
Nižšie je lepšie
Addis Abeba Počet nahrávok: 158
27,6
29,1
27,1●
Gojjam Počet nahrávok: 128
33,7●
36,1
34,8
Gonder Počet nahrávok: 63
30,2●
31,7
32,2
Shewa Počet nahrávok: 56
37,2●
39,4
39,2
Wollo Počet nahrávok: 111
34,0●
36,6
37,2
Nerodení hovoriaci (L2) Počet nahrávok: 163
27,6●
29,8
29,5
Neznáme Počet nahrávok: 95
30,2●
31,6
31,1

● najnižšia chybovosť v skupine. Každá nárečová skupina má len 56 až 163 nahrávok, takže rozdiely menšie ako približne jeden bod sú v rámci šumu.

05 · Trénovanie

Z čoho vznikol

Vychádzali sme z modelu OpenAI Whisper large-v3 a dotrénovali ho na veľkej a rozmanitej zbierke amharskej reči: čítané vety, spontánne opisy, nárečové nahrávky v telefónnej kvalite a reč z YouTube.

1,55 B
parametrov, založený na OpenAI Whisper large-v3
~1 060 h
unikátneho amharského trénovacieho zvuku
~809 h
prepísaných ľuďmi
~276 h
prepísaných učiteľským modelom a overených druhým modelom
1 300+
hovoriacich, rátajúc len zdroje, ktoré počet hovoriacich uvádzajú
~146
GPU-hodín trénovania na klasteri s 4x NVIDIA RTX 3090
Nárečia v trénovaní
Addis Abeba Gojjam Gonder Shewa Wollo

Plus široký materiál od mnohých ďalších zdrojov a hovoriacich.

Trénovaný na zašumený zvuk
Hluk v pozadí Hudba Ozvena miestnosti Telefónna kvalita Zmeny rýchlosti Zmeny hlasitosti

Približne 9 hodín syntetického ticha a šumu ho učí nevypísať nič namiesto vymýšľania textu.

06 · V Gastone

Čo získate

Model beží priamo v službe Gaston, takže z každej amharskej nahrávky vznikne prepis, ktorý môžete prehľadávať, prekladať, ukladať do záložiek, exportovať a analyzovať s AI agentom.

ሀ ለ ሐ
Etiópske písmo
Z amharského zvuku vznikne amharský text v písme ge'ez (fidel), nie prepis do latinky.
Časová značka pri každom slove
Zarovnanie na úrovni slov vám umožní kliknúť na ľubovoľné slovo v prepise a skočiť presne na ten moment.
Ticho zostane tichom
Pri tichu a šume je naučený nevypísať nič. Na žiadnej zo 774 testovacích konverzačných nahrávok nevznikla slučka opakovaní a služba navyše pridáva vlastný filter opakovaní.
Je to rýchle
7,3-minútovú nahrávku prepíše za približne 48 sekúnd na jednej GPU, zhruba 9-krát rýchlejšie ako v reálnom čase.
Čísla sa píšu slovami
Vyslovené čísla sa zobrazia ako amharské slová, nie číslice, pretože tak sú zapísané aj trénovacie prepisy.
Známe slabiny
  • •Anglické prevzaté slová a názvy značiek
  • •Občasné spojenie dvoch slov do jedného
  • •Miešanie starého a nového zápisu niekoľkých písmen (ጕ/ጉ, ኵ/ኩ)
07 · Metodika

Ako sme merali

  • Presne tak, ako model beží v produkčnej službe: zvuk rozdelený na úseky dlhé najviac 20 sekúnd, dekódovaný pomocou beam search 5.
  • Pravopisné varianty písmen, ktoré znejú rovnako, sa nepočítajú ako chyby, napríklad: ሀ/ሐ/ኀ, ሰ/ሠ
  • Horn-ASR sme nikdy nepoužili na trénovanie, ale pomohol nám vybrať najlepší checkpoint, preto je jeho výsledok veľmi mierne optimistický. Ďalšie dve testovacie sady sme nepoužili na žiadne rozhodnutie.
Testovacia sada Použitá veľkosť Poznámky
Horn-ASR
LesanAI · CC-BY-SA-4.0
774 nahrávok do 30 s (~2,5 h) Spontánne rozhovory, nikdy nepoužité na trénovanie
Dataset.ET
snapwre/amharic-speech · CC-BY-4.0
Náhodná vzorka 500 nahrávok Hovoriaci odlišní od jej trénovacej časti
WAXAL
Google WaxalNLP · CC-BY-SA-4.0
Náhodná vzorka 500 nahrávok Hovoriaci odlišní od jej trénovacej časti

Poďakovanie

Tento model by nevznikol bez otvorene licencovaných amharských rečových dát. Ďakujeme všetkým, ktorí ich vytvorili a zdieľali.

  • Založené na OpenAI Whisper large-v3 (MIT)
  • Amharic Linguistic Datasets © 2026 Leyu (gheero), CC BY 4.0 - nahrávky boli rozdelené a prefiltrované
  • Google WaxalNLP (WAXAL), CC-BY-SA-4.0
  • snapwre (Dataset.ET, amharic-speech), CC-BY-4.0
  • Google FLEURS, CC-BY-4.0
  • Mozilla Common Voice, CC0
  • Ejigu, Y. A. (2024), BDU-speech
  • ESPnet YODAS2, CC-BY-3.0
  • snapwre/hohe-asr-amharic, CC-BY-4.0 (učiteľský model, nie je súčasťou produktu)
  • MUSAN corpus (hluk v pozadí)
  • LesanAI Horn-ASR, CC-BY-SA-4.0 (len na testovanie)
ሰላም

Vyskúšajte ho na vlastných amharských nahrávkach

Nahrajte súbor alebo vložte odkaz na YouTube a o zvyšok sa postará Gaston.

Vytvoriť účet