Zadanie
Klasyfikacja tokenów.
Tokenizer składa wielkość liter.
Dane
Jedenaście książek z Wolnych Lektur.
Rozkład etykiet jest silnie niezbalansowany.
Udział etykiet w każdym zbiorze
przecinek
kropka
reszta paska: brak znaku
Model
Siedem indeksów wybiera wiersze macierzy zanurzeń E.
Inicjalizacja.
Backprop wyprowadzony na kartce.
Wyniki
Metryka to Macro-F1 na zbiorze testowym.
| Klasa | Precyzja | Czułość | F1 |
|---|---|---|---|
NONE | 0,922 | 0,922 | 0,922 |
COMMA | 0,588 | 0,467 | 0,520 |
PERIOD | 0,333 | 0,442 | 0,381 |
| Macro-F1 | 0,608 |
Pojemność modelu nie była wąskim gardłem. Była nim precyzja rzadkich klas.
| Krok | Zmiana | Macro-F1 |
|---|---|---|
| punkt wyjścia | α = 1, K = 2, lr 0,01, 10 epok | 0,535 |
| optymalizator | lr z 0,01 na 0,005, 30 epok, cierpliwość 5 | ≈ 0,555 (wal.) |
| kontekst | K z 2 na 3 | ≈ 0,559 (wal.) |
| wagi klas | α z 1 na 0,5 | 0,606 |
| retrening | α = 0,5, czysty przebieg | 0,608 |
Pełna odwrotna częstość.
Dalej
- Preprocessing i baza bigramowazrobione
- MLP, ręczny backpropzrobione
- Bi-LSTM albo mini-Transformerw toku
- Rozszerzona interpunkcja: pytajnik i wykrzyknik
- Multi-task: wielkie litery
- REST API i wersja MVP
Kod, wagi, korpus, artykuł
- Repozytorium
- Cały potok w Octave.
- Model na Hugging Face
- model.mat, karta modelu.
- Korpus na Hugging Face
- 1,2 mln par w parquet.
- Artykuł
- Cel, metoda, wyniki, wnioski.