O caminho para traduzir uma obra técnica ou um artigo científico de ponta a ponta: primeiro extrair o PDF sem sujeira, depois traduzir com fidelidade que dá para auditar página por página.
Ir para os promptsJogar o PDF na IA e pedir "traduz" não funciona.
Por que dois prompts
Quando as duas tarefas acontecem na mesma sessão, a IA traduz por cima de um texto que ela mesma bagunçou — e ninguém consegue saber depois se a frase sumiu na extração ou na tradução. Separando, cada etapa tem sua auditoria.
Cabeçalho virando parágrafo, nota de rodapé no meio da frase, capítulo que encurtou pela metade — e nenhum jeito de descobrir onde perdeu.
A extração entrega um manifesto com contagens. A tradução confere contra ele, capítulo a capítulo, e localiza qualquer perda pela âncora de página.
O caminho
O livro ou artigo que você tem direito de processar.
Markdown limpo, um arquivo por capítulo, com âncoras de página e relatório de suspeitas.
Glossário fixo, piloto aprovado por você e conferência automática a cada capítulo.
Rode no Claude Code, dentro de uma pasta só para esse livro. O prompt 1 cria a estrutura de pastas e os scripts sozinho. O prompt 2 vai numa sessão nova, na mesma pasta — é o manifesto no disco que faz a ponte entre as duas.
Prompt 1 · sessão 1
Abra o Claude Code na pasta onde está o PDF, preencha os três campos em destaque e cole. Ele executa tudo sozinho e só para se encontrar algo que impeça a continuidade.
Aja como um engenheiro de dados especializado em extração de documentos. Seu instinto profissional é a desconfiança: toda extração de PDF vem defeituosa até prova estatística em contrário. Você entrega texto auditável, não texto que apenas parece limpo.
## DADOS DO TRABALHO
- Arquivo PDF: **[NOME-DO-ARQUIVO.pdf]**
- Idioma do original: **[ex: inglês]**
- Tipo da obra: **[ex: técnica médica / negócios / narrativa / acadêmica]**
Tenho os direitos ou autorização para processar esta obra.
## SUA MISSÃO
Converter o PDF em markdown fiel, limpo, segmentado por capítulo e auditável. Você **não traduz nada**. Execute tudo de ponta a ponta sem pedir aprovação, e só me interrompa se encontrar um problema que impeça a continuidade.
## EXECUTE NESTA ORDEM
**1. Prepare o ambiente.**
Crie a árvore de pastas e mova o PDF para `original/`:
```bash
mkdir -p original src figuras
mv *.pdf original/ 2>/dev/null
```
Instale o que faltar:
```bash
pip install pymupdf4llm pymupdf --quiet
which pdftotext pdffonts || (apt-get install -y poppler-utils 2>/dev/null || echo "instale poppler-utils")
```
**2. Diagnostique o PDF.**
```bash
pdfinfo original/*.pdf
pdffonts original/*.pdf | head -20
pdftotext -f 40 -l 42 original/*.pdf - | head -60
```
Determine e me informe em uma tabela curta: número de páginas; se há camada de texto ou se é escaneado (`pdffonts` vazio = escaneado); coluna única ou dupla; presença de tabelas, fórmulas, notas de rodapé e figuras; densidade média de palavras por página; se a numeração impressa bate com a numeração do PDF e qual o deslocamento entre elas.
Se for escaneado, rode OCR antes de prosseguir:
```bash
ocrmypdf -l [código-do-idioma] --deskew --force-ocr original/livro.pdf original/livro_ocr.pdf
```
**3. Extraia.**
Use `pymupdf4llm` como padrão, com `pdftotext -layout` como conferência cruzada. Preserve rigorosamente a ordem de leitura, inclusive em coluna dupla, caixas laterais e legendas. Preserve hierarquia de títulos, itálico, negrito, listas, citações em bloco e tabelas. Extraia as imagens para `figuras/`, referencie cada uma na posição correta do fluxo e mantenha as legendas como texto normal.
**4. Higienize, nesta ordem exata.**
Escreva e rode um script Python em `scripts/limpar.py` que:
- Detecte linhas repetidas em mais de 30% das páginas e remova como cabeçalho/rodapé
- Reconstitua palavras quebradas por hifenização de fim de linha
- Reunifique linhas do mesmo parágrafo sem eliminar quebras reais de parágrafo
- Realoque notas de rodapé para o fim da seção, com marcador numerado vinculado ao ponto de chamada
- Normalize aspas, travessões e reticências para o padrão do idioma de origem
- Remova artefatos óbvios de OCR (caracteres isolados sem sentido entre espaços)
**Nunca corrija palavra real sob suspeita de erro — sinalize em vez de corrigir.**
**5. Ancore as páginas.**
A cada virada de página do original, insira um comentário HTML com o número da página **impressa**, no formato `<!-- p.42 -->`. Essas âncoras são obrigatórias: são elas que permitirão auditar omissões na tradução e conferir qualquer trecho contra o PDF em segundos.
**6. Segmente.**
Detecte fronteiras de capítulo pelo padrão de títulos e grave um arquivo por capítulo em `src/`, nomeados `cap-01.md`, `cap-02.md`, com dois dígitos. Grave separadamente `00-prefacio.md`, `00-introducao.md`, `99-apendices.md`, `99-bibliografia.md`, `99-indice.md` conforme existirem.
**7. Grave o MANIFESTO.**
Grave **em disco**, na raiz do projeto, dois arquivos:
`manifesto.json` — um objeto com a chave `capitulos`, contendo uma lista em que cada item traz: `arquivo`, `titulo`, `pagina_inicial`, `pagina_final`, `paragrafos`, `palavras`, `notas_rodape`, `figuras`, `status` (sempre `"extraido"`). Inclua também um objeto `resumo` com totais gerais e um array `suspeitas`.
`MANIFESTO.md` — a versão legível, com os mesmos números em tabela markdown, mais a seção **SUSPEITAS DE FALHA**, que deve listar obrigatoriamente:
- Páginas com contagem de palavras abaixo de 60% da média
- Tabelas cujo número de colunas varia entre linhas
- Blocos com proporção anormal de caracteres não alfabéticos
- Sequências de parágrafos muito curtos que sugiram quebra indevida
- Qualquer trecho onde a ordem de leitura pareça comprometida
Depois de gravar, rode `ls -la` e releia o `MANIFESTO.md` do disco, exibindo as primeiras 25 linhas para confirmar a gravação.
## LIMITAÇÕES ABSOLUTAS
Você nunca traduz, nunca reescreve, nunca melhora a redação do autor, nunca completa frase truncada por adivinhação e nunca remove conteúdo por julgá-lo irrelevante. Diante de qualquer dúvida sobre o que é conteúdo e o que é artefato, **mantenha o conteúdo e sinalize**.
## FORMATO DA ENTREGA FINAL
Tom técnico, direto, sem preâmbulo e sem elogio ao próprio trabalho. Feche com:
1. Tabela de capítulos com páginas e contagem de palavras
2. Lista de suspeitas de falha, ordenada por gravidade
3. Os 3 trechos que você mais recomenda que eu confira manualmente contra o PDF, com o número da página
Comece agora pelo passo 1.
Leia o MANIFESTO antes de seguir. A seção de suspeitas de falha é o mapa do que pode ter quebrado. Confira no PDF os três trechos que ele indicar — cinco minutos aqui evitam retraduzir um capítulo depois.
Prompt 2 · sessão nova
Abra uma sessão nova do Claude Code na mesma pasta — contexto limpo, o manifesto no disco como contrato. Preencha os cinco campos em destaque e cole.
Aja como um tradutor editorial sênior com vinte anos de experiência em obras de **[TIPO: técnica médica / negócios / narrativa / acadêmica]**, traduzindo de **[IDIOMA DE ORIGEM]** para **[IDIOMA DE DESTINO]**. Você é a voz do autor em outro idioma, jamais um coautor. Sua marca profissional é a fidelidade verificável: outros traduzem para soar bem, você traduz para que nada se perca — e ainda assim soa bem.
## DADOS DO TRABALHO
- Obra: **[TÍTULO]**, de **[AUTOR]**
- Público-alvo da tradução: **[ex: médicos brasileiros / leigos / pós-graduandos]**
- Registro desejado: **[ex: acadêmico formal / didático conversacional / literário]**
O livro já foi extraído de PDF e higienizado em processo anterior. Os arquivos estão em `src/`, um markdown por capítulo, com âncoras de página no formato `<!-- p.42 -->` e notas de rodapé realocadas ao fim de cada seção. Tenho os direitos ou autorização para traduzir esta obra. As traduções vão para `out/`, com nome idêntico ao arquivo de origem.
## EXECUTE NESTA ORDEM
**Passo 0 — Ingestão do contrato.**
Leia `manifesto.json` e `MANIFESTO.md` integralmente. Confirme que todo capítulo listado existe em `src/` e que as contagens de parágrafos batem com os arquivos reais. Leia a seção de suspeitas de falha de extração e trate esses pontos com atenção redobrada ao chegar neles. Se algo não bater, pare e me avise antes de traduzir uma linha. Crie a pasta `out/`.
**Passo 1 — Glossário.**
Varra o livro inteiro extraindo termos técnicos recorrentes, conceitos-chave do autor, jargão, unidades, siglas e expressões idiomáticas repetidas. Grave `GLOSSARIO.md` em tabela: termo original, tradução fixada, justificativa da escolha, capítulos onde ocorre. Onde existir mais de uma tradução consagrada no idioma de destino, registre as duas e explique a escolha. Este arquivo é lei para o resto do trabalho.
**Passo 2 — Piloto.**
Traduza um único capítulo do miolo da obra (nunca a introdução, cuja prosa é atípica). Rode o controle de qualidade do Passo 4 sobre ele, me entregue o resultado e **pare**. Só sigo com meu aval. Incorpore ao glossário tudo que eu corrigir.
**Passo 3 — Tradução em lote.**
Capítulo a capítulo, em blocos semânticos de no máximo 2.000 palavras, sempre respeitando fronteiras de seção e nunca cortando parágrafo ao meio. Antes de cada bloco, releia o `GLOSSARIO.md` e os dois últimos parágrafos já traduzidos, para preservar continuidade de tom, tempo verbal e referências anafóricas. Ao concluir cada capítulo, grave o arquivo em `out/` e atualize `STATUS.md` **imediatamente** — o processo precisa ser retomável a qualquer momento sem perda.
**Passo 4 — Controle de qualidade (após cada capítulo).**
Escreva e rode `scripts/qa.py` comparando `src/` e `out/`. Reporte:
- Paridade exata de contagem de parágrafos
- Razão de caracteres entre os idiomas dentro da faixa esperada — fora dela, sinalize como suspeita de condensação ou inchaço
- Presença de todos os números, percentuais, dosagens, datas e unidades
- Preservação de todas as âncoras de página, notas de rodapé, links, tabelas e referências a figuras
- Aderência integral ao glossário
Localize cada discrepância pela âncora de página e **corrija antes de seguir para o capítulo seguinte**.
**Passo 5 — Revisão de fluência.**
Releia o capítulo traduzido **sem consultar o original**, avaliando apenas se soa como texto escrito originalmente no idioma de destino. Onde a leitura travar, marque como suspeita de literalidade excessiva e reescreva preservando 100% do conteúdo. Registre em `REVISAO.md` toda decisão relevante, ambiguidade encontrada e passagem que admita mais de uma leitura, sempre com a âncora de página.
## REGRAS INVIOLÁVEIS
- Traduza tudo. Nenhuma frase omitida, nenhum parágrafo fundido, nenhuma redundância cortada — a redundância é escolha do autor.
- Nunca corrija, atualize ou suavize o conteúdo. Se o autor erra um dado ou usa termo datado, traduza fielmente e registre em `REVISAO.md`, jamais no corpo do texto.
- Não traduza: referências bibliográficas, nomes próprios, nomes comerciais de fármacos e dispositivos, nem títulos de obras sem confirmar a edição publicada no idioma de destino.
- Diante de ambiguidade, escolha a leitura mais próxima da literalidade e registre a alternativa descartada.
- Termo novo e recorrente fora do glossário: pare, proponha a tradução com justificativa e aguarde minha decisão.
## FORMATO DA ENTREGA
A cada capítulo: informe qual está traduzindo, grave o arquivo, exiba o resultado do QA e feche com tópicos curtos — decisões tomadas, dúvidas levantadas, próximo passo. Tom técnico e objetivo, sem preâmbulo e sem elogio ao próprio trabalho. Se identificar risco à fidelidade, diga diretamente.
Comece agora pelo Passo 0.
O piloto é o momento de intervir. Revise aquele capítulo linha a linha e corrija termos: tudo que você ajustar entra no glossário e vale para o livro inteiro. Passou do piloto, o resto sai no mesmo padrão.
Artigo científico
Um paper tem vinte páginas, não quatrocentas — mas tem coluna dupla, tabela, figura com legenda e referência, que é exatamente onde a extração ingênua quebra. Os mesmos prompts funcionam com três trocas.
Para um artigo só, o piloto do Passo 2 perde a graça: mande traduzir a seção de métodos primeiro, confira os termos, e depois libere o resto.
Direito autoral não é detalhe. Os dois prompts partem do princípio de que você é o detentor dos direitos ou tem autorização do editor — traduzir para estudo próprio é uma coisa, distribuir a tradução de uma obra de terceiros é outra. Artigo em acesso aberto tem licença própria: confira o que ela permite antes de compartilhar o resultado.
Pegue aquele livro que nunca saiu em português, rode o prompt 1 e leia o manifesto. Em uma tarde você sabe se a obra inteira é viável — e o trabalho fica retomável a qualquer momento.
Acessar comunidade