It’s an encoder-decoder transformer trained on audio (language?) and transcription.
Seems kinda weird for it not to meet the definition in a tautological way even if it’s not the typical sense or doesn’t tend to be used for autoregressive token generation?