youtube-study-automation
Automação open-source para estudo via YouTube — captura vídeos, transcreve e organiza notas automaticamente. Disponível para uso próprio.
Ver repositório ↗youtube-study-automation
Minha rotina de estudo terminava quando o vídeo acabava. Pausar para anotar interrompia a aula, e os vídeos assistidos raramente viravam material de revisão. O projeto automatiza essa etapa: recebe uma URL, transcreve o áudio, organiza o conteúdo e entrega um PDF.
Por que eu construí em vez de usar algo pronto
Eu construí o fluxo para aprender como essas etapas funcionavam em conjunto. O pipeline reúne n8n, download de vídeo, transcrição com Whisper, um modelo de linguagem local e geração de PDF. Ele é open source, roda na minha máquina e não usa uma API paga de IA.
Como o fluxo funciona
URL do vídeo
→ Download do áudio (yt-dlp)
→ Transcrição (Whisper large-v3, GPU)
→ Divisão em blocos de 8192 caracteres
→ Resumo de cada bloco (Ollama qwen2.5:14b) [Loop 1]
→ Consolidação incremental dos resumos [Loop 2]
→ Geração de PDF estilizado (Gotenberg)
→ Envio para o Discord e retorno via webhook
Todos os detalhes e o workflow prontos para importar estão no README. Em resumo: o n8n orquestra tudo; o downloader (Python/FastAPI com yt-dlp) captura o áudio; o faster-whisper transcreve na GPU; o Ollama resume cada bloco e depois consolida; o Gotenberg vira o PDF final.
Na minha máquina os tempos reais: um vídeo de 30 min leva 10–15 min de pipeline; um de 1h, 20–40 min (depende da GPU e do número de blocos).
O que mudou no meu estudo na prática
Hoje o registro acontece enquanto eu assisto: as notas saem organizadas, salvas em PDF, prontas para revisão — e eu uso esses materiais como fonte no NotebookLM quando quero aprofundar um tema específico. O atrito que matava meu estudo (pausar, copiar, anotar, nunca revisar) virou tarefa do fluxo, não minha.
O que eu trocaria na próxima versão
Com o uso frequente, apareceram duas arestas claras:
- Tiraria a IA rodando localmente. O resumo com o LLM local é lento demais para o resultado que entrega — em um vídeo longo, é o gargalo real do pipeline
- Revisaria o prompt do resumo. Hoje ele direciona o resultado, mas dá para mirar melhor a qualidade das notas
O que aprendi
O projeto transformou um vídeo assistido em material que consigo revisar e reutilizar. Também concentrou, num único fluxo, o aprendizado sobre transcrição, orquestração e modelos locais que passei a aplicar em outros projetos. O resumo local ainda precisa melhorar, principalmente em velocidade e qualidade do prompt.