От нейрона к сети
УСЛОЖНЯЕМ

15 пикселей > 10 цифр

Сеть обучена на шаблонах цифр 3×5 и их зашумлённых вариантах.

Выход — распределение вероятностей по десяти классам.

В ней 634 обучаемых параметра: 600 весов на связях и 34 bias. 

Для масштаба: в GPT‑3 — 175 млрд параметров [3].

Сеть видит894% уверенности
8
94%
9
3%
0
1%
6
1%
2
0%
634обучаемых параметра

600 весов + 34 bias

GPT‑3 175B ≈ ×276 млн
Интерактив
04/ 31