Конвертер PDF в Markdown — формулы, таблицы и код
Конвертируйте PDF в чистый Markdown онлайн — формулы, таблицы, колонки и опциональный перевод
Загрузить файл PDF
Перетащите файлы сюда или
Только PDF, макс 300MB, макс 800 стр.
Настройки
Сведения о списании баллов
- • PDF в Markdown:2 балла/стр.
- • PDF в Markdown+Перевод MD:3 балла/стр.
Как работает конвертация PDF в Markdown
KolmoPDF использует визуальную языковую модель (VLM) для анализа страниц PDF и вывода структурированного Markdown, сохраняющего смысловое содержание документа.
Что обрабатывает анализатор
- Многоколоночная вёрстка: Страницы с двумя и более колонками читаются в правильном логическом порядке, а не слева направо по физической странице.
- Математические формулы: Строчная и выносная математика выводится как LaTeX внутри Markdown, например
$E = mc^2$or$$\int_0^\infty e^{-x^2} dx$$. - Таблицы: Таблицы можно выводить как таблицы Markdown или сохранять как изображения. Экспериментальная функция объединения между страницами обнаруживает и объединяет таблицы, переходящие через разрывы страниц.
- Блоки кода: Исходный код и техническая нотация заключаются в огороженные блоки кода с указанием языка, если он определяется.
- Перевод: Включите перевод, чтобы во время разбора переводить содержимое документа на китайский, японский, корейский, французский, немецкий, испанский или русский. Добавляет 1 кредит/страницу.
Ограничения файлов
Только файлы PDF. Максимальный размер файла: 300 МБ. Максимальное число страниц: 800.
Что делает этот конвертер PDF в Markdown
KolmoPDF разбирает технические PDF в структурированный Markdown с помощью визуальной языковой модели, обученной на научных статьях, технических книгах и инженерных документах. Он сохраняет порядок чтения в несколько колонок, распознаёт формулы LaTeX в строке и в виде блоков, восстанавливает таблицы, переходящие через страницы, и сохраняет блоки кода. На выходе — чистый Markdown для генераторов статических сайтов, баз знаний и последующих конвейеров перевода.
Ключевые возможности
- Распознавание строчных и блочных формул LaTeX с поддержкой нескольких строк.
- Стабильное обнаружение таблиц с объединёнными ячейками и таблиц, продолжающихся на следующих страницах.
- Двух- и трёхколоночные страницы переупорядочиваются в линейный поток чтения.
- Обнаружение блоков кода с подсказками языка, когда источник распознаётся.
- Опциональный однопроходный перевод на 8 целевых языков во время разбора.
Частые сценарии
Исследователи извлекают LaTeX из статей в свои системы заметок. Инженерные команды направляют извлечённый Markdown в Confluence, Notion или внутренние вики. Команды локализации подают Markdown в инструменты памяти переводов. Преподаватели восстанавливают слайды и материалы из PDF учебников, не перенабирая формулы.
Частые вопросы
Работает ли с отсканированными PDF?
Да. Визуальная языковая модель обрабатывает текст как области изображения, поэтому нативные и отсканированные PDF разбираются одинаково.
Сколько стоит за страницу?
Разбор PDF — 2 кредита за страницу; с переводом в строке — 3 кредита за страницу. Новые пользователи получают 100 бесплатных кредитов при регистрации.
Каков максимальный размер файла?
Бесплатные и платные тарифы принимают файлы до 300 МБ. Лимит страниц зависит от остатка кредитов.
Real parse: Attention Is All You Need
This is the actual Markdown KolmoPDF produced from Vaswani et al. 2017 — a two-column academic PDF with display math and a results table. Not a mock, not a screenshot of the product UI.


Equation 1 as extracted LaTeX
$$
\text{Attention}(Q, K, V) = \text{softmax}(\frac{QK^T}{\sqrt{d_k}})V
$$Table 1 as a GitHub-flavored Markdown table
| Layer Type | Complexity per Layer | Sequential Operations | Maximum Path Length |
| :--- | :---: | :---: | :---: |
| Self-Attention | $O(n^2 \cdot d)$ | $O(1)$ | $O(1)$ |
| Recurrent | $O(n \cdot d^2)$ | $O(n)$ | $O(n)$ |
| Convolutional | $O(k \cdot n \cdot d^2)$ | $O(1)$ | $O(log_k(n))$ |
| Self-Attention (restricted) | $O(r \cdot n \cdot d)$ | $O(1)$ | $O(n/r)$ |The dominant sequence transduction models are based on complex recurrent or convolutional neural networks that include an encoder and a decoder. We propose a new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.