Converter PDF para Markdown — Fórmulas, tabelas e código
Converta PDF em Markdown limpo online — fórmulas, tabelas, multi-coluna e tradução opcional
Enviar arquivo PDF
Arraste e solte os arquivos aqui, ou
Somente PDF, máx 300MB, máx 800 páginas
Configurações
Informações de dedução de pontos
- • PDF para Markdown:2 pts/pág.
- • PDF para Markdown+Tradução MD:3 pts/pág.
Como funciona a conversão de PDF para Markdown
O KolmoPDF usa um modelo de linguagem visual (VLM) para analisar as páginas do PDF e gerar Markdown estruturado que preserva o conteúdo semântico do documento.
O que o analisador trata
- Layouts com várias colunas: Páginas com duas ou mais colunas são lidas na ordem lógica correta, não da esquerda para a direita ao longo da página física.
- Fórmulas matemáticas: Matemática em linha e em bloco é exibida como LaTeX dentro do Markdown, por exemplo
$E = mc^2$or$$\int_0^\infty e^{-x^2} dx$$. - Tabelas: As tabelas podem ser exibidas como tabelas Markdown ou mantidas como imagens. O recurso experimental de mesclagem entre páginas detecta e une tabelas que atravessam quebras de página.
- Blocos de código: O código-fonte e a notação técnica são colocados em blocos de código delimitados, com dicas de linguagem quando detectável.
- Tradução: Ative a tradução para converter o conteúdo do documento em chinês, japonês, coreano, francês, alemão, espanhol ou russo durante a análise. Adiciona 1 crédito/página.
Limites de arquivo
Apenas arquivos PDF. Tamanho máximo: 300 MB. Número máximo de páginas: 800.
O que este conversor de PDF para Markdown faz
O KolmoPDF analisa PDFs técnicos em Markdown estruturado usando um modelo de linguagem visual treinado com artigos acadêmicos, livros técnicos e documentos de engenharia. Ele preserva a ordem de leitura em várias colunas, reconhece fórmulas LaTeX em linha e em bloco, reconstrói tabelas que atravessam páginas e mantém os blocos de código intactos. A saída é um Markdown limpo, pronto para geradores de sites estáticos, bases de conhecimento e pipelines de tradução.
Principais recursos
- Reconhecimento de fórmulas LaTeX em linha e em bloco, com suporte a múltiplas linhas.
- Detecção estável de tabelas com células mescladas e tabelas que continuam entre páginas.
- Páginas de duas e três colunas reordenadas em um fluxo de leitura linear.
- Detecção de blocos de código com dicas de linguagem quando a fonte é identificável.
- Tradução opcional em uma passagem para 9 idiomas de destino durante a análise.
Casos de uso comuns
Pesquisadores extraem LaTeX dos artigos para seus sistemas de notas. Equipes de engenharia enviam o Markdown extraído para Confluence, Notion ou wikis internos. Equipes de localização o alimentam em ferramentas de memória de tradução. Educadores reconstroem slides e materiais a partir de PDFs de livros didáticos sem redigitar as equações.
Perguntas frequentes
Funciona com PDFs digitalizados?
Sim. O modelo de linguagem visual trata o texto como regiões de imagem, então PDFs nativos e digitalizados são analisados da mesma forma.
Quanto custa por página?
A análise de PDF custa 2 créditos por página; com tradução em linha, 3 créditos por página. Novos usuários recebem 100 créditos gratuitos no cadastro.
Qual é o tamanho máximo de arquivo?
Planos gratuitos e pagos aceitam arquivos de até 300 MB. O limite de páginas depende do seu saldo de créditos.
Análise real: Attention Is All You Need
Este é o Markdown que o KolmoPDF produziu de fato a partir de Vaswani et al. 2017 — um PDF acadêmico de duas colunas com fórmulas e tabela de resultados. Não é mock nem captura da interface.


Equação 1 extraída em LaTeX
$$
\text{Attention}(Q, K, V) = \text{softmax}(\frac{QK^T}{\sqrt{d_k}})V
$$Table 1 como tabela Markdown no estilo GitHub
| Layer Type | Complexity per Layer | Sequential Operations | Maximum Path Length |
| :--- | :---: | :---: | :---: |
| Self-Attention | $O(n^2 \cdot d)$ | $O(1)$ | $O(1)$ |
| Recurrent | $O(n \cdot d^2)$ | $O(n)$ | $O(n)$ |
| Convolutional | $O(k \cdot n \cdot d^2)$ | $O(1)$ | $O(log_k(n))$ |
| Self-Attention (restricted) | $O(r \cdot n \cdot d)$ | $O(1)$ | $O(n/r)$ |The dominant sequence transduction models are based on complex recurrent or convolutional neural networks that include an encoder and a decoder. We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.