gzucob.
← projetos

youtube-study-automation

Automação open-source para estudo via YouTube — captura vídeos, transcreve e organiza notas automaticamente. Disponível para uso próprio.

Ver repositório ↗

youtube-study-automation

Minha rotina de estudo terminava quando o vídeo acabava. Pausar para anotar interrompia a aula, e os vídeos assistidos raramente viravam material de revisão. O projeto automatiza essa etapa: recebe uma URL, transcreve o áudio, organiza o conteúdo e entrega um PDF.

Por que eu construí em vez de usar algo pronto

Eu construí o fluxo para aprender como essas etapas funcionavam em conjunto. O pipeline reúne n8n, download de vídeo, transcrição com Whisper, um modelo de linguagem local e geração de PDF. Ele é open source, roda na minha máquina e não usa uma API paga de IA.

Como o fluxo funciona

text
URL do vídeo
  → Download do áudio (yt-dlp)
  → Transcrição (Whisper large-v3, GPU)
  → Divisão em blocos de 8192 caracteres
  → Resumo de cada bloco (Ollama qwen2.5:14b) [Loop 1]
  → Consolidação incremental dos resumos [Loop 2]
  → Geração de PDF estilizado (Gotenberg)
  → Envio para o Discord e retorno via webhook

Todos os detalhes e o workflow prontos para importar estão no README. Em resumo: o n8n orquestra tudo; o downloader (Python/FastAPI com yt-dlp) captura o áudio; o faster-whisper transcreve na GPU; o Ollama resume cada bloco e depois consolida; o Gotenberg vira o PDF final.

Na minha máquina os tempos reais: um vídeo de 30 min leva 10–15 min de pipeline; um de 1h, 20–40 min (depende da GPU e do número de blocos).

O que mudou no meu estudo na prática

Hoje o registro acontece enquanto eu assisto: as notas saem organizadas, salvas em PDF, prontas para revisão — e eu uso esses materiais como fonte no NotebookLM quando quero aprofundar um tema específico. O atrito que matava meu estudo (pausar, copiar, anotar, nunca revisar) virou tarefa do fluxo, não minha.

O que eu trocaria na próxima versão

Com o uso frequente, apareceram duas arestas claras:

  • Tiraria a IA rodando localmente. O resumo com o LLM local é lento demais para o resultado que entrega — em um vídeo longo, é o gargalo real do pipeline
  • Revisaria o prompt do resumo. Hoje ele direciona o resultado, mas dá para mirar melhor a qualidade das notas

O que aprendi

O projeto transformou um vídeo assistido em material que consigo revisar e reutilizar. Também concentrou, num único fluxo, o aprendizado sobre transcrição, orquestração e modelos locais que passei a aplicar em outros projetos. O resumo local ainda precisa melhorar, principalmente em velocidade e qualidade do prompt.