音声だったりテキストだったりよりも、画像が学習のための前処理がやりやすいっていうのはあるっぽい。

機械学習で入力を扱う際、まず扱うものをコンピュータで解釈できるようにデータ化する必要がある(標本化だったり量子化だったり…)。 その上で、機械学習でモデルで扱うために、適切な変換を実施して有用な特徴量を構築していく。

画像だと、データ化と特徴量化の間に大きな差異はない。MNISTなんかだと元データから一次元のベクトルにしてモデルに突っ込んだりするが、正直それだけ。

テキストは本当にわからない、なんなんだお前は。(連続的なデータを扱うのが得意なモデルに無理やり離散的なデータ突っ込んでるので、そのためのテクニックが諸々ある感じ?)