🎧 Prefere ouvir?
Este artigo tem narração em áudio. Aperte o play e ouça enquanto faz outra coisa.
Passei meses tentando identificar uma ave no quintal. Construí uma skill Alexa para não precisar passar de novo.
Um casal de aves verdes aparecia toda manhã no mesmo fio, perto de casa. Eu tinha certeza de que não eram maritacas — o tamanho era diferente, o barulho era diferente. Mas eu não sabia o nome delas.
Foram meses. Procurei no WikiAves, que é referência no Brasil e um trabalho excelente — mas para um iniciante como eu, a quantidade de informação era mais intimidante do que útil. Eu não sabia os termos certos pra filtrar. Não sabia se “verde com mancha vermelha na asa” era um sabiá exótico ou um psitacídeo comum. Descobri depois: eram ararinhas Maracanã.
E aí veio a ironia que plantou tudo: fui verificar como seria o chamado delas pra confirmar, e descobri que psitacídeos não têm chamado padronizado. O canto que eu queria usar como prova simplesmente não existe de forma classificável. O desafio já estava na minha cabeça.
A primeira ideia era errada (e antiética)
Meu plano original era usar a Alexa para ouvir os sons das aves ao redor e identificar por áudio. Dois problemas mataram essa ideia no mesmo dia:
A Alexa só capta voz humana. Ela não escuta o ambiente — o microfone é otimizado para comandos falados. Sons de fundo são ruído, não sinal. Não existe um “modo escuta” que eu pudesse ativar.
Atrair aves com playback é uma prática questionável. Reproduzir o canto de uma espécie para atraí-la causa estresse territorial, pode afastar aves de ninhos e interfere na reprodução. A IN ICMBio 14/2018 e o CEMAVE orientam contra isso. Quando descobri, descartei a ideia sem pensar duas vezes.
Então a skill virou outra coisa: em vez de “grave o que você ouviu”, virou “descreva o que você viu”. Fale com a Alexa em linguagem natural — cor, tamanho, onde estava, formato do bico — e ela devolve as espécies mais prováveis.
A stack: Python, Bayes e quatro bases abertas que não se falam
A Alexa não é exatamente um equipamento inteligente. Ela reconhece voz e chama uma função na nuvem. Toda a inteligência está num Lambda (Python) na AWS, e o trabalho de verdade foi fazer quatro bases de dados que não foram feitas para conversar entre si produzirem uma resposta coerente.
AVONET (Tobias et al. 2022, CC BY 4.0) tem traços morfológicos padronizados para mais de 11 mil espécies — é de lá que vêm os 7 atributos que a skill extrai da sua descrição: cor principal, cor secundária, tamanho por âncora, ambiente, posição, bico e cauda.
GBIF tem registros de ocorrência de aves no Brasil. Usei esses dados como prior bayesiano: se você está em São Paulo e descreve “ave verde grande”, o scorer pesa mais as espécies que de fato aparecem na região (raio de 30 km, com pelo menos 20 registros). Bem-te-vi antes de espécie rara com a mesma descrição.
xeno-canto tem as gravações reais dos cantos. E aqui entra uma decisão que não era opcional pra mim: eu não poderia simplesmente me conectar aos áudios sem creditar quem gravou. Cada reprodução mostra o nome do gravador, a licença (CC BY-NC-SA 4.0) e o número da gravação no acervo. Python se mostrou ótimo para capturar esses áudios e organizar tanto espécies quanto autores de forma programática.
Han et al. 2025 (CC0) complementa com dados de cores de plumagem que a AVONET não cobre.
O slot type AMAZON.SearchQuery em pt-BR captura fala livre — “vi um passarinho amarelo com asas pretas no chão do quintal” entra inteiro como texto e o parser extrai os atributos. Não há menu, não há “diga 1 para cor”. Você fala como falaria para um amigo.
Os números, sem inventar nada
1.627 espécies do Brasil inteiro. 1.014 com gravação real do xeno-canto. A base começou com 390 espécies da região de São Paulo e foi expandida para cobrir todos os biomas brasileiros.
Acurácia simulada com ruído realista (descrições incompletas, atributos errados, sinônimos regionais): a ave certa aparece entre as 3 primeiras sugestões em ~54% dos casos. Não é 90%. É o que o modelo entrega hoje com dados abertos e um parser que aceita fala livre. A transparência sobre esse número importa mais do que arredondá-lo pra cima.
Tem também um quiz de cantos: a skill toca uma gravação real e você tenta adivinhar a espécie. Acertou, ela conta o placar. Errou, ela revela qual era e toca de novo pra você associar. É um jeito de treinar o ouvido sem precisar estar no campo.
E o maior gargalo de engenharia não foi o scorer — foi o Alexa Developer Console. Testar uma skill Alexa é um processo lento, com deploys que demoram, logs que atrasam e uma interface que pouca gente domina. Quem já desenvolveu pra Alexa sabe. Quem não desenvolveu, vai descobrir.
O que a skill NÃO faz (de propósito)
Ela não grava o som da ave — a Alexa não consegue. Ela não reproduz cantos em loop pra atrair aves — isso é antiético. Ela não tem métricas de uso porque acabou de ser publicada. Ela não tem depoimentos de usuários porque eu não vou inventar. WikiAves, xeno-canto, GBIF e AVONET são fontes creditadas, não parceiros.
Cada reprodução de canto vem com aviso de playback responsável. Reprodução única, volume controlado, crédito ao gravador, orientação sobre época reprodutiva. Isso não é feature — é obrigação.
O convite: teste, quebre, melhore
O código é MIT e o repositório é público: github.com/jvitorcarvalho/aves-do-brasil-alexa.
Eu quero que as pessoas se divirtam com isso. Que descubram o canto do urutau, que é uma das coisas mais curiosas que você vai ouvir. Que identifiquem uma ave no quintal e contem pro amigo no almoço. Que um desenvolvedor de Manaus pegue o repositório e calibre os priors pra Amazônia. Que um ornitólogo corrija os nomes populares que vieram do GBIF e provavelmente têm erros.
Hoje a skill cobre o Brasil inteiro — 1.627 espécies, 1.014 com gravação. Tem espaço.
Para testar: “Alexa, abre Aves do Brasil”. É gratuita, sem anúncios, sem coleta de dados.
Para contribuir: abra uma issue, mande um PR, ou me diga que o nome popular do tico-tico na sua cidade é outro. Tudo ajuda.
Desenvolvida por Evolutiva Negócios Digitais (João Monlevade/MG). Fontes: AVONET (Tobias et al. 2022, CC BY 4.0), GBIF (CC0), xeno-canto (CC BY-NC-SA 4.0), Han et al. 2025 (CC0), WikiAves (consulta pública). Aviso de playback conforme IN ICMBio 14/2018 e diretrizes CEMAVE.
Perguntas frequentes
Como a skill Aves do Brasil identifica uma ave pela descrição falada?
A skill usa um scorer bayesiano que cruza 7 atributos extraídos da sua fala — cor, tamanho, ambiente, posição, bico, cauda e cor secundária — com dados morfológicos de 1.627 espécies brasileiras. A base vem da AVONET (Tobias et al. 2022), complementada por dados de ocorrência do GBIF para ponderar espécies mais prováveis na sua região. Você descreve o que viu em linguagem natural e recebe as espécies mais compatíveis com a descrição.
A skill reproduz cantos para atrair aves?
Não. A skill reproduz gravações reais do xeno-canto apenas uma vez por consulta, com volume controlado e crédito ao gravador original. Reproduzir cantos em loop para atrair aves causa estresse territorial e pode interferir na reprodução — prática desaconselhada pela IN ICMBio 14/2018 e pelo CEMAVE. Cada reprodução vem acompanhada de aviso de playback responsável.
Qual a taxa de acerto da identificação por voz?
Em simulações com ruído realista (descrições incompletas, atributos errados, sinônimos regionais), a ave certa aparece entre as 3 primeiras sugestões em aproximadamente 54% dos casos. Esse número reflete o desempenho atual com dados abertos e um parser de fala livre. A skill não arredonda métricas — a transparência sobre as limitações é intencional.
A skill Aves do Brasil é gratuita e coleta dados pessoais?
A skill é gratuita, sem anúncios e sem coleta de dados pessoais. O código é open source sob licença MIT, disponível no repositório público. As bases de dados usadas (AVONET, GBIF, xeno-canto, Han et al. 2025) são todas abertas e devidamente creditadas.
Posso contribuir com a skill ou corrigir nomes populares de aves?
Sim. O repositório aceita issues e pull requests — contribuições de ornitólogos, desenvolvedores e observadores de aves são bem-vindas. Nomes populares regionais que diferem dos registros do GBIF podem ser corrigidos diretamente. A base atual cobre 1.627 espécies do Brasil e 1.014 com gravação real, mas há espaço para calibração regional e expansão.
