← Back to Blog

    Pesquisa de áudio: como coletar respostas faladas

    By ·Published 30 de setembro de 2026·8 min read

    Quem busca "pesquisa de áudio" encontra sobretudo estudos sobre som. Se o que você quer é um questionário em que as pessoas respondem falando, há quatro formas de fazer isso. Veja como elas diferem e como decidir.

    O que se entende por “pesquisa de áudio”

    Digite a expressão no Google e a primeira página traz sobretudo estudos acadêmicos sobre áudio: sistemas de melhoria de som, hábitos de escuta, modelos acústicos. Ninguém que procura isso quer montar um questionário. O sentido desta página é mais estreito: uma pesquisa em que pelo menos algumas respostas são faladas, e não digitadas. Você faz a pergunta em texto, a pessoa toca em um botão e fala, e você recebe a resposta como áudio, como transcrição ou os dois.

    Quem faz essa pergunta costuma estar em uma de duas situações. Tem uma pergunta aberta que recebe respostas digitadas de uma linha e quer respostas mais ricas. Ou seus respondentes digitam mal — pelo celular, em um segundo idioma, com pouca escolaridade — e falar é simplesmente o canal mais fácil. Em ambos os casos a pergunta prática é a mesma: como colocar respostas faladas na pesquisa que eu já tenho?

    Quatro formas de coletar respostas em áudio em uma pesquisa

    Existem só quatro arquiteturas. Elas se diferenciam pelo lugar onde a gravação acontece e pelo que o respondente precisa deixar para trás para gravar.

    AbordagemO que o respondente fazO que isso custa para você
    1. Um tipo de pergunta de áudio nativoToca em gravar dentro da pesquisaOs limites e o plano que a plataforma associa ao recurso
    2. Um widget de gravação dentro da sua pesquisa atualToca em gravar dentro da pesquisaColar um script em uma plataforma que permita executar seu próprio JavaScript
    3. Envio de arquivo de áudioGrava no celular e depois envia o arquivoAtrito para o respondente, e transcrever e associar os arquivos por conta própria
    4. Uma entrevista moderada por IA ou uma linha telefônicaSai do seu questionário e conversa com outro sistemaOutro instrumento, hospedado em outro lugar, com exportação própria

    1. Uma pergunta de áudio nativa

    Se a sua plataforma tem uma, use. O Typeform, por exemplo, oferece um tipo de pergunta de Vídeo e Áudio com transcrição automática, mas cada resposta é limitada a dois minutos e o recurso fica atrás dos planos Growth ou Talent. Saber se a sua plataforma tem algo parecido é uma questão de documentação, e mantemos uma tabela conferida com a documentação de cada uma em Which survey platforms support voice responses (em inglês). Leia antes de construir qualquer coisa; em algumas plataformas a resposta termina ali.

    2. Um widget de gravação dentro da pesquisa que você já tem

    A maioria das plataformas profissionais de pesquisa não grava voz, mas várias permitem adicionar seu próprio HTML e JavaScript à página que o respondente vê. Isso basta para que um gravador viva dentro da pergunta: o respondente não sai da pesquisa, a lógica do questionário e as cotas ficam intactas, e o resultado é gravado de volta no mesmo campo, então aparece na sua exportação normal. O Voice Capture é uma ferramenta desse tipo: um trecho de código que você cola no Alchemer, QuestionPro, FormAssembly ou Sawtooth Lighthouse Studio, ou em qualquer formulário web que aceite HTML próprio (o suporte ao Qualtrics chega em breve). Os guias de configuração estão em /integrations.

    A rota do widget tem um limite que vale dizer cedo: plataformas que removem o JavaScript personalizado — o SurveyMonkey é a mais comum — não conseguem hospedá-lo de jeito nenhum.

    3. Envio de arquivo de áudio

    Alguns formulários permitem anexar um arquivo. Para áudio, isso significa gravar com outro aplicativo, achar o arquivo e enviá-lo: três passos onde o widget tem um. A taxa de conclusão cai a cada passo, e você herda uma pasta de arquivos sem transcrição, que depois precisa transcrever e associar ao respondente certo pelo ID. Funciona para um painel pequeno e motivado. Não escala para uma amostra da população geral.

    4. Uma entrevista moderada por IA ou uma linha telefônica

    Uma categoria de produto totalmente diferente: o respondente sai do seu questionário para uma conversa conduzida por outro sistema. É a escolha certa quando você quer aprofundamento e perguntas de acompanhamento, e a errada quando você quer uma resposta aberta falada dentro de uma pesquisa estruturada, com cotas e lógica de salto. A comparação está em AI-moderated interviews vs voice in your survey (em inglês).

    Você precisa da gravação ou só do que foi dito?

    Esta é a decisão que quase todos os guias pulam, e ela muda qual abordagem fica aberta para você.

    A maioria das perguntas abertas em pesquisa de mercado é codificada, citada e contada como texto. Para isso, a entrega é a transcrição, e o áudio é um subproduto. Se esse é o seu caso, guardar arquivos de áudio é tanto um passivo quanto um ativo: gravações da voz de uma pessoa são dados pessoais, exigem uma política de retenção e precisam ser apagadas a pedido do titular.

    O áudio em si importa quando o som é o dado: análise de tom e emoção, um vídeo de destaques com vozes reais de clientes para uma apresentação, ou uma exigência regulatória de manter o original. Nesse caso você precisa de uma ferramenta que armazene gravações.

    O Voice Capture foi feito para o primeiro caso e é honesto sobre o segundo: o áudio é transcrito e descartado, e só o texto é armazenado, em infraestrutura sediada na UE. Se você precisa guardar as gravações, ele não é a ferramenta certa, e uma das abordagens baseadas em arquivos acima é.

    Como desenhar uma pergunta de áudio que funcione

    Uma pergunta falada falha de um jeito diferente de uma digitada, e a maior parte das falhas está no enunciado, não na tecnologia.

    • Peça uma coisa só. “Conte o que você gostou, o que não gostou e o que mudaria” gera uma resposta divagante e difícil de codificar. Uma pergunta, um tema.
    • Avise sobre a permissão do microfone. O navegador pede permissão uma vez, e é nesse aviso que a maioria desiste. Uma linha de texto antes da pergunta — você pode responder esta falando; seu navegador vai pedir acesso ao microfone — elimina quase todo o atrito.
    • Mantenha a opção de digitar. Nem todo mundo pode ou quer falar, e um lugar público é ruim para ser obrigado a isso. Ofereça a voz como opção e deixe uma resposta digitada e uma falada para a mesma pergunta caírem na mesma coluna.
    • Defina a expectativa de duração. A duração máxima da resposta no Voice Capture depende do plano — 90 segundos no teste gratuito, 180 no Essential, 300 no Professional —, então escreva o enunciado para caber. Uma pergunta que pede um monólogo de cinco minutos é uma entrevista, não um item de pesquisa.
    • Faça um lançamento piloto. Envie um décimo da amostra, leia você mesmo as transcrições e confirme que o enunciado produz o tipo de resposta esperado antes de enviar o restante.

    Como os dados ficam depois

    As respostas faladas são mais longas que as digitadas — nos nossos próprios dados de produção, cerca de duas vezes mais longas: 23,1 palavras em média contra 10,1 digitadas, em 693 respostas de voz e 6.476 digitadas, e não a diferença de uma ordem de grandeza que alguns fornecedores anunciam. A amostra e as ressalvas estão em /methodology. Elas também são transcritas, não digitadas, então confira uma amostra em busca de marcas e jargões da categoria ouvidos errado de forma sistemática; uma marca que sai errada sempre do mesmo jeito é um localizar e substituir, não um problema. O guia longo de todo o fluxo, do campo à codificação, está no complete guide to voice surveys (em inglês).

    Perguntas frequentes

    Posso adicionar respostas em áudio a uma pesquisa que já construí?

    Normalmente sim, se a sua plataforma permite executar JavaScript próprio na página do respondente. Você adiciona um script uma vez e o aponta para a pergunta que deve aceitar uma resposta falada. Se a sua plataforma remove o JavaScript personalizado, você precisa da pergunta de áudio nativa dela (se tiver) ou de outra plataforma.

    Os respondentes precisam instalar alguma coisa?

    Não. O Voice Capture usa a permissão de microfone padrão do navegador — sem aplicativo nem plugin — e funciona no Safari do iOS e no Chrome do Android. Se um navegador não consegue gravar, o widget se esconde e a caixa de texto continua funcionando, então ninguém chega a um beco sem saída.

    Quais idiomas uma pesquisa de áudio consegue tratar?

    O Voice Capture transcreve 36 idiomas, incluindo português. No teste gratuito o idioma fica travado em um depois do seu primeiro projeto; os pacotes pagos incluem todos.

    As gravações são armazenadas?

    Não pelo Voice Capture: o áudio é transcrito e descartado, e só o texto é mantido. Se você precisa das gravações originais, use uma ferramenta que armazene arquivos e planeje a política de retenção e exclusão que isso exige.

    Quanto custa?

    Um crédito é uma resposta transcrita, e os créditos não expiram. O teste gratuito inclui 250 créditos; o pacote Essential custa US$ 99 por 1.000 créditos. Os pacotes vigentes estão na página de preços.

    Por onde começar

    Decida primeiro se você precisa da gravação ou só das palavras, e depois veja se a sua plataforma já tem uma pergunta de áudio nativa. Se não tem, mas aceita JavaScript próprio, os guias de configuração pegam uma pesquisa que você já tem e adicionam uma opção falada a uma pergunta. O teste gratuito é suficiente para fazer um lançamento piloto.

    Ready to add voice to your surveys?

    Start free — no credit card required. Setup takes 2 minutes.

    Try Voice Capture Free