2 prompts · Claude Code

Traduza um livro inteiro sem perder uma frase

O caminho para traduzir uma obra técnica ou um artigo científico de ponta a ponta: primeiro extrair o PDF sem sujeira, depois traduzir com fidelidade que dá para auditar página por página.

Ir para os prompts

Jogar o PDF na IA e pedir "traduz" não funciona.

Por que dois prompts

Extrair e traduzir são trabalhos diferentes

Quando as duas tarefas acontecem na mesma sessão, a IA traduz por cima de um texto que ela mesma bagunçou — e ninguém consegue saber depois se a frase sumiu na extração ou na tradução. Separando, cada etapa tem sua auditoria.

Uma sessão só

Cabeçalho virando parágrafo, nota de rodapé no meio da frase, capítulo que encurtou pela metade — e nenhum jeito de descobrir onde perdeu.

Duas sessões

A extração entrega um manifesto com contagens. A tradução confere contra ele, capítulo a capítulo, e localiza qualquer perda pela âncora de página.

O caminho

Do PDF ao livro traduzido

Entrada

PDF original

original/

O livro ou artigo que você tem direito de processar.

Prompt 1

Extração

src/ + manifesto

Markdown limpo, um arquivo por capítulo, com âncoras de página e relatório de suspeitas.

Prompt 2

Tradução

out/ + QA

Glossário fixo, piloto aprovado por você e conferência automática a cada capítulo.

Rode no Claude Code, dentro de uma pasta só para esse livro. O prompt 1 cria a estrutura de pastas e os scripts sozinho. O prompt 2 vai numa sessão nova, na mesma pasta — é o manifesto no disco que faz a ponte entre as duas.

Os prompts

Um de cada vez, nesta ordem

Prompt 1 · sessão 1

Extração e higienização do PDF

Abra o Claude Code na pasta onde está o PDF, preencha os três campos em destaque e cole. Ele executa tudo sozinho e só para se encontrar algo que impeça a continuidade.

Prompt 1 · extração
Aja como um engenheiro de dados especializado em extração de documentos. Seu instinto profissional é a desconfiança: toda extração de PDF vem defeituosa até prova estatística em contrário. Você entrega texto auditável, não texto que apenas parece limpo.

## DADOS DO TRABALHO

- Arquivo PDF: **[NOME-DO-ARQUIVO.pdf]**
- Idioma do original: **[ex: inglês]**
- Tipo da obra: **[ex: técnica médica / negócios / narrativa / acadêmica]**

Tenho os direitos ou autorização para processar esta obra.

## SUA MISSÃO

Converter o PDF em markdown fiel, limpo, segmentado por capítulo e auditável. Você **não traduz nada**. Execute tudo de ponta a ponta sem pedir aprovação, e só me interrompa se encontrar um problema que impeça a continuidade.

## EXECUTE NESTA ORDEM

**1. Prepare o ambiente.**

Crie a árvore de pastas e mova o PDF para `original/`:

```bash
mkdir -p original src figuras
mv *.pdf original/ 2>/dev/null
```

Instale o que faltar:

```bash
pip install pymupdf4llm pymupdf --quiet
which pdftotext pdffonts || (apt-get install -y poppler-utils 2>/dev/null || echo "instale poppler-utils")
```

**2. Diagnostique o PDF.**

```bash
pdfinfo original/*.pdf
pdffonts original/*.pdf | head -20
pdftotext -f 40 -l 42 original/*.pdf - | head -60
```

Determine e me informe em uma tabela curta: número de páginas; se há camada de texto ou se é escaneado (`pdffonts` vazio = escaneado); coluna única ou dupla; presença de tabelas, fórmulas, notas de rodapé e figuras; densidade média de palavras por página; se a numeração impressa bate com a numeração do PDF e qual o deslocamento entre elas.

Se for escaneado, rode OCR antes de prosseguir:

```bash
ocrmypdf -l [código-do-idioma] --deskew --force-ocr original/livro.pdf original/livro_ocr.pdf
```

**3. Extraia.**

Use `pymupdf4llm` como padrão, com `pdftotext -layout` como conferência cruzada. Preserve rigorosamente a ordem de leitura, inclusive em coluna dupla, caixas laterais e legendas. Preserve hierarquia de títulos, itálico, negrito, listas, citações em bloco e tabelas. Extraia as imagens para `figuras/`, referencie cada uma na posição correta do fluxo e mantenha as legendas como texto normal.

**4. Higienize, nesta ordem exata.**

Escreva e rode um script Python em `scripts/limpar.py` que:

- Detecte linhas repetidas em mais de 30% das páginas e remova como cabeçalho/rodapé
- Reconstitua palavras quebradas por hifenização de fim de linha
- Reunifique linhas do mesmo parágrafo sem eliminar quebras reais de parágrafo
- Realoque notas de rodapé para o fim da seção, com marcador numerado vinculado ao ponto de chamada
- Normalize aspas, travessões e reticências para o padrão do idioma de origem
- Remova artefatos óbvios de OCR (caracteres isolados sem sentido entre espaços)

**Nunca corrija palavra real sob suspeita de erro — sinalize em vez de corrigir.**

**5. Ancore as páginas.**

A cada virada de página do original, insira um comentário HTML com o número da página **impressa**, no formato `<!-- p.42 -->`. Essas âncoras são obrigatórias: são elas que permitirão auditar omissões na tradução e conferir qualquer trecho contra o PDF em segundos.

**6. Segmente.**

Detecte fronteiras de capítulo pelo padrão de títulos e grave um arquivo por capítulo em `src/`, nomeados `cap-01.md`, `cap-02.md`, com dois dígitos. Grave separadamente `00-prefacio.md`, `00-introducao.md`, `99-apendices.md`, `99-bibliografia.md`, `99-indice.md` conforme existirem.

**7. Grave o MANIFESTO.**

Grave **em disco**, na raiz do projeto, dois arquivos:

`manifesto.json` — um objeto com a chave `capitulos`, contendo uma lista em que cada item traz: `arquivo`, `titulo`, `pagina_inicial`, `pagina_final`, `paragrafos`, `palavras`, `notas_rodape`, `figuras`, `status` (sempre `"extraido"`). Inclua também um objeto `resumo` com totais gerais e um array `suspeitas`.

`MANIFESTO.md` — a versão legível, com os mesmos números em tabela markdown, mais a seção **SUSPEITAS DE FALHA**, que deve listar obrigatoriamente:

- Páginas com contagem de palavras abaixo de 60% da média
- Tabelas cujo número de colunas varia entre linhas
- Blocos com proporção anormal de caracteres não alfabéticos
- Sequências de parágrafos muito curtos que sugiram quebra indevida
- Qualquer trecho onde a ordem de leitura pareça comprometida

Depois de gravar, rode `ls -la` e releia o `MANIFESTO.md` do disco, exibindo as primeiras 25 linhas para confirmar a gravação.

## LIMITAÇÕES ABSOLUTAS

Você nunca traduz, nunca reescreve, nunca melhora a redação do autor, nunca completa frase truncada por adivinhação e nunca remove conteúdo por julgá-lo irrelevante. Diante de qualquer dúvida sobre o que é conteúdo e o que é artefato, **mantenha o conteúdo e sinalize**.

## FORMATO DA ENTREGA FINAL

Tom técnico, direto, sem preâmbulo e sem elogio ao próprio trabalho. Feche com:

1. Tabela de capítulos com páginas e contagem de palavras
2. Lista de suspeitas de falha, ordenada por gravidade
3. Os 3 trechos que você mais recomenda que eu confira manualmente contra o PDF, com o número da página

Comece agora pelo passo 1.
[NOME-DO-ARQUIVO.pdf] O arquivoNome exato do PDF, com a extensão. Ele precisa estar na pasta onde você abriu o Claude Code.
[idioma] Língua do originalInglês, espanhol, alemão. Serve para normalizar aspas e travessões e para escolher o idioma do OCR.
[tipo da obra] Natureza do textoTécnica médica, acadêmica, narrativa. Muda o que conta como artefato e o que é escolha do autor.

Leia o MANIFESTO antes de seguir. A seção de suspeitas de falha é o mapa do que pode ter quebrado. Confira no PDF os três trechos que ele indicar — cinco minutos aqui evitam retraduzir um capítulo depois.

Prompt 2 · sessão nova

Tradução fiel

Abra uma sessão nova do Claude Code na mesma pasta — contexto limpo, o manifesto no disco como contrato. Preencha os cinco campos em destaque e cole.

Prompt 2 · tradução
Aja como um tradutor editorial sênior com vinte anos de experiência em obras de **[TIPO: técnica médica / negócios / narrativa / acadêmica]**, traduzindo de **[IDIOMA DE ORIGEM]** para **[IDIOMA DE DESTINO]**. Você é a voz do autor em outro idioma, jamais um coautor. Sua marca profissional é a fidelidade verificável: outros traduzem para soar bem, você traduz para que nada se perca — e ainda assim soa bem.

## DADOS DO TRABALHO

- Obra: **[TÍTULO]**, de **[AUTOR]**
- Público-alvo da tradução: **[ex: médicos brasileiros / leigos / pós-graduandos]**
- Registro desejado: **[ex: acadêmico formal / didático conversacional / literário]**

O livro já foi extraído de PDF e higienizado em processo anterior. Os arquivos estão em `src/`, um markdown por capítulo, com âncoras de página no formato `<!-- p.42 -->` e notas de rodapé realocadas ao fim de cada seção. Tenho os direitos ou autorização para traduzir esta obra. As traduções vão para `out/`, com nome idêntico ao arquivo de origem.

## EXECUTE NESTA ORDEM

**Passo 0 — Ingestão do contrato.**

Leia `manifesto.json` e `MANIFESTO.md` integralmente. Confirme que todo capítulo listado existe em `src/` e que as contagens de parágrafos batem com os arquivos reais. Leia a seção de suspeitas de falha de extração e trate esses pontos com atenção redobrada ao chegar neles. Se algo não bater, pare e me avise antes de traduzir uma linha. Crie a pasta `out/`.

**Passo 1 — Glossário.**

Varra o livro inteiro extraindo termos técnicos recorrentes, conceitos-chave do autor, jargão, unidades, siglas e expressões idiomáticas repetidas. Grave `GLOSSARIO.md` em tabela: termo original, tradução fixada, justificativa da escolha, capítulos onde ocorre. Onde existir mais de uma tradução consagrada no idioma de destino, registre as duas e explique a escolha. Este arquivo é lei para o resto do trabalho.

**Passo 2 — Piloto.**

Traduza um único capítulo do miolo da obra (nunca a introdução, cuja prosa é atípica). Rode o controle de qualidade do Passo 4 sobre ele, me entregue o resultado e **pare**. Só sigo com meu aval. Incorpore ao glossário tudo que eu corrigir.

**Passo 3 — Tradução em lote.**

Capítulo a capítulo, em blocos semânticos de no máximo 2.000 palavras, sempre respeitando fronteiras de seção e nunca cortando parágrafo ao meio. Antes de cada bloco, releia o `GLOSSARIO.md` e os dois últimos parágrafos já traduzidos, para preservar continuidade de tom, tempo verbal e referências anafóricas. Ao concluir cada capítulo, grave o arquivo em `out/` e atualize `STATUS.md` **imediatamente** — o processo precisa ser retomável a qualquer momento sem perda.

**Passo 4 — Controle de qualidade (após cada capítulo).**

Escreva e rode `scripts/qa.py` comparando `src/` e `out/`. Reporte:

- Paridade exata de contagem de parágrafos
- Razão de caracteres entre os idiomas dentro da faixa esperada — fora dela, sinalize como suspeita de condensação ou inchaço
- Presença de todos os números, percentuais, dosagens, datas e unidades
- Preservação de todas as âncoras de página, notas de rodapé, links, tabelas e referências a figuras
- Aderência integral ao glossário

Localize cada discrepância pela âncora de página e **corrija antes de seguir para o capítulo seguinte**.

**Passo 5 — Revisão de fluência.**

Releia o capítulo traduzido **sem consultar o original**, avaliando apenas se soa como texto escrito originalmente no idioma de destino. Onde a leitura travar, marque como suspeita de literalidade excessiva e reescreva preservando 100% do conteúdo. Registre em `REVISAO.md` toda decisão relevante, ambiguidade encontrada e passagem que admita mais de uma leitura, sempre com a âncora de página.

## REGRAS INVIOLÁVEIS

- Traduza tudo. Nenhuma frase omitida, nenhum parágrafo fundido, nenhuma redundância cortada — a redundância é escolha do autor.
- Nunca corrija, atualize ou suavize o conteúdo. Se o autor erra um dado ou usa termo datado, traduza fielmente e registre em `REVISAO.md`, jamais no corpo do texto.
- Não traduza: referências bibliográficas, nomes próprios, nomes comerciais de fármacos e dispositivos, nem títulos de obras sem confirmar a edição publicada no idioma de destino.
- Diante de ambiguidade, escolha a leitura mais próxima da literalidade e registre a alternativa descartada.
- Termo novo e recorrente fora do glossário: pare, proponha a tradução com justificativa e aguarde minha decisão.

## FORMATO DA ENTREGA

A cada capítulo: informe qual está traduzindo, grave o arquivo, exiba o resultado do QA e feche com tópicos curtos — decisões tomadas, dúvidas levantadas, próximo passo. Tom técnico e objetivo, sem preâmbulo e sem elogio ao próprio trabalho. Se identificar risco à fidelidade, diga diretamente.

Comece agora pelo Passo 0.
[TIPO] Gênero da obraDefine o repertório do tradutor: técnica médica não se traduz como narrativa.
[ORIGEM → DESTINO] Par de idiomasTambém calibra a razão de caracteres esperada no controle de qualidade.
[TÍTULO] e [AUTOR] A obraAjuda a IA a reconhecer termos consagrados e edições já publicadas em português.
[PÚBLICO] Quem vai lerMédicos, residentes, leigos. Muda o quanto de jargão sobrevive na tradução.
[REGISTRO] Tom do textoAcadêmico formal, didático, literário. A única liberdade de estilo que o tradutor tem.

O piloto é o momento de intervir. Revise aquele capítulo linha a linha e corrija termos: tudo que você ajustar entra no glossário e vale para o livro inteiro. Passou do piloto, o resto sai no mesmo padrão.

Artigo científico

Três ajustes e o mesmo caminho serve

Um paper tem vinte páginas, não quatrocentas — mas tem coluna dupla, tabela, figura com legenda e referência, que é exatamente onde a extração ingênua quebra. Os mesmos prompts funcionam com três trocas.

seções, não capítulos SegmentaçãoPeça um arquivo por seção do artigo — resumo, introdução, métodos, resultados, discussão — em vez de capítulos.
coluna dupla Ordem de leituraÉ o erro clássico em paper: a IA lê atravessado as duas colunas. O diagnóstico do prompt 1 já detecta e trata.
números intactos Dados e estatísticaO QA já confere p-valores, intervalos de confiança, dosagens e unidades um a um contra o original.

Para um artigo só, o piloto do Passo 2 perde a graça: mande traduzir a seção de métodos primeiro, confira os termos, e depois libere o resto.

Direito autoral não é detalhe. Os dois prompts partem do princípio de que você é o detentor dos direitos ou tem autorização do editor — traduzir para estudo próprio é uma coisa, distribuir a tradução de uma obra de terceiros é outra. Artigo em acesso aberto tem licença própria: confira o que ela permite antes de compartilhar o resultado.

Sua vez

Comece por um capítulo

Pegue aquele livro que nunca saiu em português, rode o prompt 1 e leia o manifesto. Em uma tarde você sabe se a obra inteira é viável — e o trabalho fica retomável a qualquer momento.

Acessar comunidade