Я использую OSX и хотел бы иметь возможность конвертировать PDF файлы в текст.
Я хотел бы бесплатное приложение, чтобы сделать это, так как я уверен, что они должны быть.
Я использую OSX и хотел бы иметь возможность конвертировать PDF файлы в текст.
Я хотел бы бесплатное приложение, чтобы сделать это, так как я уверен, что они должны быть.
Ответы:
Вот шаги, которые я использовал для установки и использования xpdf через Homebrew.
Установите зависимости Homebrew:
xcode-select --install
Установите Homebrew с их сайта:
/usr/bin/ruby -e "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/master/install)"
Сделайте то, что он говорит вам, чтобы завершить установку Homebrew.
Убедитесь, что Homebrew счастлив и функционирует по спецификации.
brew doctor
Далее установите xpdf и его зависимости:
brew install Caskroom/cask/xquartz
brew install xpdf
Наконец, используйте pdftotext, пакет, входящий в комплект xpdf:
pdftotext Some_Document.pdf Some_Document.txt
Первое имя файла - это существующий PDF; Второй пункт назначения. Результаты были намного лучше, чем с (по общему признанию) старой версией Adobe Acrobat. Изменить: Новые (2019) версии Adobe Acrobat показали столь же плохие результаты.
xquartzне нужно для инструментов консоли в xpdf. Кроме того, есть popplerразвилка, xpdfкоторая, как представляется, поддерживается гораздо активнее: github.com/scraperwiki/scraperwiki-python/issues/…
Несколько методов.
Используйте документы Google (вам потребуется аккаунт Google)
Использовать Automator (требуется некоторая работа)
Вы можете использовать Automator для создания рабочего процесса, который может извлекать текст из PDF-файлов и сохранять его как текстовый или RTF-документ.

или приложение из App Store, например, PDF в текст
xpdf который я установил с портами:
port install xpdf
содержит:
xpdf-pdftotext
Он делает то, что вы хотите для любого файла PDF, который приходит из текстового файла (а не из изображения):
xpdf-pdftotext PDF_file text_file
Текущая версия Adobe Reader (11.0.09) имеет пункт «Сохранить как другое» в меню «Файл».
Одним из вариантов является Текст .
Приложение бесплатно, и делает достойную работу, выводя текстовые файлы. Все изображения в новом документе будут потеряны в формате .txt.
Я думаю, вы сможете скопировать и вставить текст в другой документ. Выделить весь текст
Обратите внимание, что если вы попытаетесь это сделать, и текст не вставлен, а просто пустые строки, попробуйте сначала распечатать PDF в новый PDF, например
Теперь попробуйте описанный выше процесс с этим новым PDF. Работал на меня!
PS: если у вас есть Microsoft Word, вы можете открыть свой PDF в слове
Следующий скрипт Python выведет текст из документа PDF в файл .txt. (Примечание: нет никакой гарантии, что текст обязательно находится в «логическом» удобочитаемом для человека порядке из-за способа хранения данных в формате PDF.)
Сценарий создаст текстовые файлы для любых файлов PDF, предоставленных в качестве аргументов ему в командной строке (например, pdf2txt.py myPDF.pdf), или вы можете использовать в действии Automator «Выполнить сценарий оболочки», установив тип оболочки в python и передать ввод в качестве аргументов «As». , Тогда вы можете использовать его как Quick Action или DropApp.
#!/usr/bin/python
# coding: utf-8
import os, sys
from Quartz import PDFDocument
from CoreFoundation import (NSURL, NSString)
NSUTF8StringEncoding = 4
def pdf2txt():
for filename in sys.argv[1:]:
inputfile =filename.decode('utf-8')
shortName = os.path.splitext(filename)[0]
outputfile = shortName+" text.txt"
pdfURL = NSURL.fileURLWithPath_(inputfile)
pdfDoc = PDFDocument.alloc().initWithURL_(pdfURL)
if pdfDoc :
pdfString = NSString.stringWithString_(pdfDoc.string())
pdfString.writeToFile_atomically_encoding_error_(outputfile, True, NSUTF8StringEncoding, None)
if __name__ == "__main__":
pdf2txt()
if pdfDocоператора на print(pdfDoc.string()).