Na máquina do usuário, não na nossa nuvem
Foi a decisão mais cara e a primeira. Rodar o reconhecimento de fala em servidor nosso seria mais simples de manter e teria funcionado em qualquer sistema operacional. Escolhemos o contrário: o modelo é baixado no disco durante a instalação e a transcrição acontece ali. O preço é uma configuração inicial mais longa e uma dependência do hardware de quem usa. O ganho é a única coisa que resolvia a dor de origem — o áudio não sai.