Вы здесьТипичные ошибки распознавания - собираем статистику для скрипта ФБЕ
Опубликовано чт, 06/01/2011 - 11:12 пользователем TaKir
Собираю статистику по наиболее частым типичным ошибкам распознавания для включения их в скрипт ФБЕ: Варианты: Прошу участвовать всех желающих. Дополненный список я хочу включить в недавно обновленный скрипт "Поиск по набору регэкспов", автор Sclex (http://groups.google.com/group/fiction-book-editor/browse_thread/thread/b4700ee54d255384), работающий под ФБЕ. Сейчас данный скрипт у меня ищет: Использование этого скрипта заметно сокращает время работы над книгой в ФБЕ.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
weis RE:Прошу переформатировать, распознать, etc... 4 дня
Океана RE:Подайте бедному копеечку на книжку с литреса... 10 часов Larisa_F RE:Национальный бестселлер (лауреаты и финалисты) 1 неделя sem14 RE:Премия «Фемина» 2 недели tvv RE:Багрепорт - 2 2 недели sem14 RE:Беляевская премия 3 недели sem14 RE:Серия "Очень прикольная книга", издательство Азбука-классика 3 недели Larisa_F RE:Что читать о блокаде Ленинграда. Подборка книг 1 день sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 1 месяц Larisa_F RE:Дэвид Герберт Лоуренс собрание в 7 томах том 3 1 месяц sem14 RE:Собираем серию: "Мастер серия", издательство "Лимбус". 1 месяц sibkron RE:«Словенский глагол» 1 месяц Tramell RE:Литературная премия имени И.А. Ефремова 1 месяц sem14 RE:Серия "Что есть что" издательства "Слово"(чего не хватает) 1 месяц larin RE:Оплатил, но абонемент не отображается 1 месяц epoost RE:Чарльз Брокден Браун - Wieland 2 месяца nehug@cheaphub.net RE:Ответственность. 2 месяца nehug@cheaphub.net RE:Доступ 2 месяца Впечатления о книгах
udrees про Мантикор: Город, которого нет 10: Власть Мотылька (Фэнтези, ЛитРПГ, Самиздат, сетевая литература)
03 10 Достаточно сложноватое для чтения повествование, ввиду того что главный герой все время рассуждает, и рассуждения написаны достаточно тяжелым языком. Для любителей наверное серий автора про Город которого нет, Покорившего ……… Оценка: неплохо
udrees про Мантикор: Город, которого нет 9: Власть Мотылька (Фэнтези, ЛитРПГ, Самиздат, сетевая литература)
03 10 Не знаю зачем автор создал еще одну серию «Власть мотылька», с теми же героями, что в другой серии «Город которого нет», с такими же параметрами мира, сущностями и наверное сюжетом. Наверное обе серии будут тесно связаны. ……… Оценка: хорошо
udrees про Шиленко: Смотритель маяка (Фэнтези, ЛитРПГ, Самиздат, сетевая литература)
03 10 Простая приятная книга про «жизнь» попаданца на какой-то маяк в каком-то потустороннем мире, где ночью туман сжирает все живое, а днем в океане плавают монстры, которые запросто перекусывают корабли. В общем написано доступным ……… Оценка: неплохо
udrees про Вальтер: Гниль (Боевая фантастика, Приключения: прочее, Постапокалипсис, Самиздат, сетевая литература)
03 10 Ужасная книга про ужасных персонажей, продолжение их похождений. Кто читал две предыдущие книги, знает что за психопаты – главные герои, и какие они отморозки и маньяки, любящие убивать, пытать, расчленять и поедать людей, ……… Оценка: неплохо
udrees про Каменистый: Не триумфатор (Боевая фантастика, Фэнтези, Попаданцы, ЛитРПГ)
03 10 Продолжение не скучное, хотя больших битв в этой книге нет. Понравится любителям серии, главный герой наконец-то покидает степную страну и направляется на настоящую большую войну. Снова интриги, козни, наемные убийцы. Все ……… Оценка: отлично!
udrees про Дорничев: Дворник 25-го уровня. Том 10 (Юмор: прочее, Городское фэнтези, Самиздат, сетевая литература)
03 10 Сляпанный на скорую руку высер незрелого ума. Ничего нового не придумано, сказка для взрослых. В книге полно цветных картинок, сделанных нейросетью по сюжету. Рассматривать их прикольно, как детскую книжку листаешь. Книга ……… Оценка: плохо
udrees про Дорничев: Дворник 22-го уровня. Том 9 (Юмор: прочее, Городское фэнтези, ЛитРПГ, Самиздат, сетевая литература)
03 10 Слишком простая книга, которая была совсем проходной, если бы не обилие цветных картинок, иногда по 2 на одну страницу. Они превращают книгу в детскую сказку для взрослых, листаешь себе книжку и рассматриваешь веселые картинки, ……… Оценка: неплохо
udrees про Дорничев: Дворник 20-го уровня. Том 8 (Юмор: прочее, Городское фэнтези, ЛитРПГ, Самиздат, сетевая литература)
03 10 Такая простая и наивная детская книжка, наполненная сказочными зверями, феями и призраками. Кажется с первой книги вся история сильно деградировала, как главный герой стал слишком сильным. Книга напоминает детскую также обилием ……… Оценка: плохо
udrees про Михайлов: Пепел доверия 4 (Боевая фантастика, Социальная фантастика, Постапокалипсис, Самиздат, сетевая литература)
03 10 Невероятно продолжение истории выживания в зомби-апокалипсисе. Мало того, сама концепция зомби совершенно новая, я такой не встречал ранее у других. Разные были зомби, но таких, в которых можешь обратиться сам и любой человек ……… Оценка: отлично!
udrees про Атаманов: Стратег из ниоткуда. Книга четвёртая (Боевая фантастика, Героическая фантастика, Фэнтези, Самиздат, сетевая литература)
03 10 Достойная книга, написана живо, интересно, с юмором. Конечно как взрослая сказка – кругом орки, огры, великаны, эльфы. Главный герой в основном стратег, чем боевой герой, хотя в сражениях тоже принимает участие. Но по-моему ……… Оценка: отлично!
udrees про Карелин: Имперский повар [СИ] (Боевая фантастика, Фэнтези, Попаданцы, Самиздат, сетевая литература)
03 10 Достаточно легко читаемые приключения попаданца-повара в тело другого повара в другом мире, где конечно же никто не в курсе наших блюд. Все у героя получается с пол-тычка, даже умения повара в уличной драке оказывается пригодились, ……… Оценка: неплохо
udrees про Сугралинов: Голодные звёзды (Боевая фантастика, Постапокалипсис, ЛитРПГ, Самиздат, сетевая литература)
03 10 Продолжение понравилось. Автор не дает передохнуть, битвы идут одни за другими. Все как в компьютерной игре, где надо отстроить базу, развиться, подмять ресурсы, раскидать характеристики и начать побеждать противников. Герой ……… Оценка: отлично! |
Комментарии
Отв: Типичные ошибки распознавания - собираем статистику ...
Слова "оп, пи, опа" вообще-то существуют.Редко-редко, но они встречаются. Используя скрипт - рискуем их потерять.
Хотя... из той же области: па (на), Ас (А с), пет (нет)
Отв: Типичные ошибки распознавания - собираем статистику ...
Скрипт только ищет и выделяет подозрительное место курсором. Автозамена не планируется )
Отв: Типичные ошибки распознавания - собираем статистику ...
Пробелы перед знаками препинания, в начале и в конце абзаца. Отсутствие пробела вокруг тире. Несколько пробелов подряд.
Но это всё фигня, это поиском с regexp'ом лечится. А вот со слипшимися абзацами разобраться бы... Единственный более-менее хинт: если ни с того ни с сего после скана появляется разорванный в самом начале абзац, значит, одной-двумя строками выше точно два или более абзаца слиплись.
Отв: Типичные ошибки распознавания - собираем статистику ...
ив - и в (союз с предлогом)
ас - а с (то же)
оказал - сказал
опросил - спросил
Но эти случаи лучше проверять по бумажной книге.
Отв: Типичные ошибки распознавания - собираем статистику ...
...ьщик... => ...ыцик...
Отв: Типичные ошибки распознавания - собираем статистику ...
Тайме -- Таймс (и с маленькой буквы тоже)
Нуда -- ну да.
Кстати, концы строк без знаков препинания ищутся скриптом "Интерактивная ликвидация разрывов абзацев". Можно не дублировать.
Смесь букв с цифрами и неполный курсив/болд слова ищутся скриптом "Слипшиеся слова". Можно тоже не дублировать.
А что значит "неправильные дефисы-тире"?
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Ты когда им последний раз пользовался? И какой версией?
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Он давным-давно прерываем и очень удобно структурирован. Кроме того, можно показать спорное место перед принятием решения.
Обязательно поменяй на новую версию. Думаю, что он и под 2.4 будет работать.
Отв: Типичные ошибки распознавания - собираем статистику ...
Вы, может быть, путаете "Интерактивную ликвидацию разрывов абзацев" со скриптом jurgennt'а "Разрыв предложения"? "Интерактивная ликвидация" - это которая в одно окно выводит цитаты сомнительных мест и для каждого сомнительного места - радио-кнопки с вариантами обработки (скриншот). И "Ликвидация" с самого начала была прерываемой.
(Ссылку на скачивание последней версии можно найти в этом топике (не в первом сообщении). А вот последняя версия на текущий момент.)
Отв: Типичные ошибки распознавания - собираем статистику ...
"Неправильные дефисы-тире" - это просто прилипшие дефисы.
типа -так
или- так
Генуборка их не убирает.
Скрипт "Интерактивная ликвидация разрывов абзацев" удобен просто для правки.
А быстрый поиск всех вхождений рваных абзацев очень быстро помогает искать и форматировать стихи, цитаты и проч. )
Так что одно другому не только не помеха, но и очень даже наоборот )
Скриптом "Слипшиеся слова" я пользуюсь, хотя что-то в нем мне не очень нравится... То ли его тормознутость и кажущаяся тяжеловесность, то ли еще что.
Стараюсь вычистить максимум без его участия, а потом уже контрольный в голову с его помощью )
Тайме -- Таймс - часто встречается, но я предпочел в ФР-словарь занести, когда столкнулся пару раз ) но включить можно, если не для книг про спорт )
Отв: Типичные ошибки распознавания - собираем статистику ...
Да, действительно, в спортивной книге можно проколоться. Но если ты говоришь, что он будет интерактивный, то, наверное, нестрашно. ;)
Насчёт тормознутости и тяжеловесности: надеюсь, ты последней версией пользуешься? Прерываемой и запускаемой с места курсора.
Отв: Типичные ошибки распознавания - собираем статистику ...
Я говорю, что он будет?
Он уже есть ) Как минимум несколько версий уже тестировалось, зря не пользуешься )
Просто вешается на хоткей (у меня F2) и показывает по очереди все проблемные места.
Окон никаких нет, просто курсор выделяет найденную кривизну, а уж что с ней делать - дело хозяйское )
Скрипт "Слипшиеся слова" последней версии у меня, но еще с первых версий не люблю это вечно убегающее в верхний угол окошко, стараюсь все, что можно, поправить сначала без помощи этого скрипта, ибо так быстрее получается )
Отв: Типичные ошибки распознавания - собираем статистику ...
Эээээ?!
А я? А я? А как же я? (с)
Кинь в меня ссылкой, пжалста.
upd:
Ой-ой-ой... *посыпает пеплом голову* Я поняла, о чём ты. О скрипте по регэкспам. Да, я им не пользуюсь. Что-то не заладилось. :(
А ты свои идеи просто туда добавляешь?
Отв: Типичные ошибки распознавания - собираем статистику ...
Ну да, собираю всякие явные косяки и пишу в этот скрипт.
И быстро кнопочкой по всей книге тынц-тынц-тынц...
Оченно облегчает жизнь, однако )
Можно создать несколько шаблонов этого скрипта и юзать по необходимости нужный из них, или быстро закомментировать какую-то строку или добавить еще что-то и на ходу продолжать проверку )
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Я тоже не очень поняла, как занесение в словарь помогает выловить эту ошибку.
Такир, объяснишь подробнее?
Отв: Типичные ошибки распознавания - собираем статистику ...
Если в словаре ФР нет слова Таймс, то он даже при хорошем качестве скана будет распознавать слово как Тайме. Почему именно тайме - хз.
Если слово занести в словарь и перераспознать текст - это слово по всему документу будет распознано как Таймс.
Точно так же в свое время я матюкался на слово лабрадор - есть полуостров Лабрадор, и есть порода собак - лабрадор (с маленькой буквы).
ФР знал только название полуострова, и тупо везде распознавал Лабрадор вместо лабрадор, хотя в тексте было с маленькой буквы и скан отличный..
Занес в словарь, и все стало как надо )
Отв: Типичные ошибки распознавания - собираем статистику ...
Убедительно! И с "лабрадором" я тоже постоянно удивляюсь, чего это оно постоянно с большой буквы.
Так и сделаю. Спасибо. :)
Отв: Типичные ошибки распознавания - собираем статистику ...
Я тебе в личку написал, но не уверен, что отправилось нормально...
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Джонс, Робертс - понятно почему...
Джон-Джона-Джоне-Джоном
Роберт-Роберте-Робертом
надо добавлять подобные имена в словарь ФР и указывать как склоняется )
Отв: Типичные ошибки распознавания - собираем статистику ...
Обидно только, что этап разборки с несловарными словами и неуверенно распознанными у меня наступает в самом конце - после отлова битых переносов, обработки слипшихся/порвавшихся абзацев и выискивания типовых кривораспознанностей. Придётся перепридумывать алгоритм обработки. :-(
Отв: Типичные ошибки распознавания - собираем статистику ...
ф - гр, ью - ыо
Отв: Типичные ошибки распознавания - собираем статистику ...
па - на
Отв: Типичные ошибки распознавания - собираем статистику ...
Их исправляет скрипт - СЛИПШИЕСЯ СЛОВА. Тем более его можно теперь остановить в любой момент. да и работает вроде шустро..
Отв: Типичные ошибки распознавания - собираем статистику ...
Ну, не то, чтобы исправляет, но хотя бы находит...
upd. и не находит, кстати...
скрипт "Слипшиеся слова" распрекрасно игнорирует подобные конструкции:
он- приобретет
легко переносит -утрату
Отв: Типичные ошибки распознавания - собираем статистику ...
На "он- приобретет", реагирует.
А на "переносит -утрату", нет.
Отв: Типичные ошибки распознавания - собираем статистику ...
Обязательно проглядываю вот эти штуки:
ыо - ью
иа - на
па - на
пе - не
ие - не
ке - не
оп - он
Отв: Типичные ошибки распознавания - собираем статистику ...
Спасибо всем отозвавшимся!
Прилагаю свой дополненный скрипт, в который всегда можно добавить или убавить что-то еще.
Положить в папку Scripts ФБЕ, назначить на него любой удобный хоткей (сервис-настройки-клавиши-скрипты-«Поиск по набору регэкспов», присвоить нужную клавишу) и пользоваться.
http://narod.ru/disk/2874190001/Poisk_po_naboru_regexpov_TaKir.rar.html
Все добавленные мною регеспы помещены в теле скрипта между
// -------------начало блока TaKir - регэкспы:
// -------------конец блока TaKir - регэкспы:
// - строки закомментарены, т.е. не работают. Удобно для быстрого включения-выключения некоторых строк из скрипта. Правится в обычном блокноте.
Прошу желающих тестировать, отзываться и дополнять.
Еще раз спасибо Sclex, автору скрипта "Поиск по набору регэкспов" за очередную важную полезняшку! ))
Также спасибо Marina_Ch за помощь и тестирование скрипта и регэкспов
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Еще можно искать "ббльш", "чтб", и прочие слова, в которых из "о" с ударением получается "б".
Отв: Типичные ошибки распознавания - собираем статистику ...
довольно часто, - пробел буква н пробел , на самом деле всегда буква и
и ещё довольно часто і является ! , или находясь в середине слова никакой нагрузки не несет
Отв: Типичные ошибки распознавания - собираем статистику ...
Данная ошибка выискиваются скриптом "слипшиеся слова".
Отв: Типичные ошибки распознавания - собираем статистику ...
добавлю букву н и остальные буквы, которые практически никогда не встречаются в окружении пробелов (типа ф, м, п, т...)
латинская i среди русских букв скриптом ловится.
Отв: Типичные ошибки распознавания - собираем статистику ...
В Публичной библиотеке Ершова как-то видел словари замен со словами с ошибками для программы CLTXT.
Отв: Типичные ошибки распознавания - собираем статистику ...
"совеем" вместо "совсем".
Отв: Типичные ошибки распознавания - собираем статистику ...
лее -> же
Отв: Типичные ошибки распознавания - собираем статистику ...
Буква "Ж" очень зависит от шрифта. Если жирный курсив с ней при распозновании творится что-то жуткое. :) Что угодно, только не "Ж".
Отв: Типичные ошибки распознавания - собираем статистику ...
Ага. В одной книжке "ж" постоянно распознавалось как "яс". Особенно хорошо слово "хуже" получилось :) Но "лее" чаще попадается.
Отв: Типичные ошибки распознавания - собираем статистику ...
ср - ф, ею - его
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
В русском языке не так уж много слов с буквой "ф". Можно научить скрипт всем вариантам.
Отв: Типичные ошибки распознавания - собираем статистику ...
Поиск по морфологическому словарю нашел 30808 словоформ с буквой "ф". Для скрипта это слишком много.
Отв: Типичные ошибки распознавания - собираем статистику ...
Може быть есть возможность сделать выборку на сочетания, которые чаще брешут
-сф-фс-фё-ёф-рф-фр-фю-юф-фф-фы-ыф-фэ-
Как-то так примерно
И ещё, Скрипт показывает в фамилии с инициалами только инициалы. Это правильно? Г.К.Жуков
Отв: Типичные ошибки распознавания - собираем статистику ...
Нет. Правильно Г. К. Жуков.
Отв: Типичные ошибки распознавания - собираем статистику ...
Вот и я о том. А скрипт вторую точку ( в Г.
К.Жуков игнорирует.Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
http://rghost.ru/3908064
Страницы