Вы здесьТипичные ошибки распознавания - собираем статистику для скрипта ФБЕ
Опубликовано чт, 06/01/2011 - 11:12 пользователем TaKir
Собираю статистику по наиболее частым типичным ошибкам распознавания для включения их в скрипт ФБЕ: Варианты: Прошу участвовать всех желающих. Дополненный список я хочу включить в недавно обновленный скрипт "Поиск по набору регэкспов", автор Sclex (http://groups.google.com/group/fiction-book-editor/browse_thread/thread/b4700ee54d255384), работающий под ФБЕ. Сейчас данный скрипт у меня ищет: Использование этого скрипта заметно сокращает время работы над книгой в ФБЕ.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
Aliki RE:Подайте бедному копеечку на книжку с литреса... 1 день
Larisa_F RE:Современная корейская литература. Книжная серия... 1 день kopak RE:На 78-м году жизни скончался советский и российский... 4 дня Саша из Киева RE:Кто сможет раздобыть и оцифровать нужные мне книги? 5 дней Саша из Киева RE:Подводное течение 6 дней Larisa_F RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 1 неделя lemma7 RE:Серия «Интеллектуальный детектив» изд-ва АСТ 1 неделя konst1 RE:Переименовать ник (имя учетки) 1 неделя Larisa_F RE:Таррин Фишер 4 недели Aleks_Sim RE:Беженцы с Флибусты 4 недели Саша из Киева RE:Как приобретать друзей и оказывать влияние на людей 1 месяц Isais RE:Семейственность в литературе 1 месяц miri.ness_ RE:Доступ 27 1 месяц bmusanov Оплатил, но абонемент не отображается 1 месяц holla RE:Багрепорт - 2 1 месяц konst1 RE:Файнридер для Win11 1 месяц larin RE:Оплатил, но абонемент не отображается 1 месяц sem14 RE:Книжная серия «Сlio» издательства "Евразия" 1 месяц Впечатления о книгах
udrees про Хитченс: Бог не любовь: Как религия все отравляет [god Is Not Great: How Religion Poisons Everything ru] (Религия)
13 09 Совершенно чумовая книга, обличающая всю неприглядную сторону религии и связанных с ней мифов, обычаев, заблуждений и кровавых эксцессов. Очень похожа на другую такую же великолепную книгу Ричарда Докинза «Бог как иллюзия», ……… Оценка: отлично!
udrees про Дубина: Путь нечисти (Городское фэнтези, ЛитРПГ, Самиздат, сетевая литература)
13 09 Писанина, любительская, примитивная и понятная. Сленг автора сквозит из каждого предложения и слова. Конструкции предложений тоже простые как три рубля – пошел, ударил, накачал. Обороты простые, речевые, вот примеры их: «Офигенски, ……… Оценка: плохо
udrees про Карелин: Шизанутый [СИ] (Постапокалипсис, Самиздат, сетевая литература)
13 09 Обычная средненькая по описанию книга в жанре литРПГ и попаданцев. Вся предыстория – это вначале несколько абзацев про то, как герой готовился к концу Света и его тут же переносит на 300 лет вперед. Написано примитивно, очень ……… Оценка: плохо
udrees про Макграт: Является ли «научное богословие» интеллектуальным нонсенсом? [диалог с Ричардом Докинзом] (Религиоведение, Публицистика, Христианство)
13 09 Слишком много словоблудия, непонятных словесных оборотов, щедро пересыпаемых богословскими рассуждениями ни о чем. Критика Докинза тоже на мой взгляд высосана из пальца. Аргументов я не увидел, только одни оправдания. Много ……… Оценка: нечитаемо
udrees про Трефил: Воображаемая жизнь. Путешествие в поисках разумных инопланетян, ледяных существ и супергравитационных животных [litres] (Научная литература: прочее)
13 09 Развлекательное чтиво, не особо серьезное, рассчитанное на массового читателя. Автор просто рассуждает в широком смысле – вот есть такие то планеты, как бы стали развиваться там не просто живые, а даже разумные существа. ……… Оценка: плохо
udrees про Виленкин: Мир многих миров: Физики в поисках иных вселенных (Физика, Астрономия и Космос)
13 09 Книга для любителей физики и интересующихся проблемами сотворения вселенной. В принципе автор пытался донести основные теории общедоступным языком, хотя понятия квантовой физики сами по себе очень тяжеловесны. По-моему Нильс ……… Оценка: неплохо
dolle про Михайлов: Пепел доверия 2 (Боевая фантастика, Постапокалипсис, Самиздат, сетевая литература)
13 09 Поклонникам Низшего, Перекрёстка, Астероид-Сити точно не понравится. Оценка: отлично!
Oleg68 про Кобен: Обещай мне [Promise Me ru] (Крутой детектив)
12 09 Книга понравилась. Автор, как всегда , на высоте. Оценка: отлично!
мила7 про Кароль: Фокус мироздания [litres] (Любовная фантастика, Попаданцы)
11 09 Не так уж и плохо, как по мне, на хорошую четверку. В заявленном жанре. Оценка: хорошо
Columbus про Василий Васильевич Головачев
11 09 Писатель протянул достаточно долго для диагноза рак мозга. Ю. Петухов и до 60 не дожил.
Саша из Киева про Донских: Вижу сердцем [litres] (Современная проза)
09 09 Огромное спасибо тому, кто раздобыл эту книгу и разместил её здесь!
svetik489 про Василий Васильевич Головачев
08 09 21 июня 1948 - 07 сентября 2025г. 7 сентября 2025 года советский и российский писатель-фантаст, сценарист, актер, продюсер и художник Василий Головачев ушел из жизни. Ему было 77 лет. Похороны пройдут в родном городе писателя Жуковке в Брянской области. |
Комментарии
Отв: Типичные ошибки распознавания - собираем статистику ...
Сайт группы по улучшению ФБЕ http://groups.google.com/group/fiction-book-editor
Отв: Типичные ошибки распознавания - собираем статистику ...
wotti Раньше пробовал его подключать на кнопку в панели инструментов - у меня почему-то пропали все подсказки в нижней области окна... - это я один такой не счастливый? Да, Вы забыли сказать - чтоб поместить любой скрипт в панель инструментов - нужно создать иконку с именем скрипта и поместить ее рядом со скриптом.
Отв: Типичные ошибки распознавания - собираем статистику ...
Насчёт иконки - вы правы, это нужно подчеркнуть.
Но скрипт можно и "подвесить" на hotkey. Я с этим именно так и сделала. Подсказки слева внизу - ОК.
Отв: Типичные ошибки распознавания - собираем статистику ...
Ну на многие скрипты есть штатные иконки, но таки да.
я пользуюсь версией ФБЕ 2.5 (2.6 у меня на ХР почему-то дико тормозит) А фича подсказки внизу экрана предусмотрена, ЕМНИП, только начиная с 2.6. Но я как-то привык уже без подсказок обходится )))
УПД. На кнопку в панели инструментов или панели скриптов?
Отв: Типичные ошибки распознавания - собираем статистику ...
Ошибся, да ставил на панель скриптов.
Так на работе стоит FBE 2.6 (Win XP) и если помещаю на панель, то подсказки пропадают... да ладно, эт не существенно.
Дома вынужден пользоваться FBE 2.5, т.к. в FBE 2.6 были проблемы с сохранением.
А на панель инструментов можно добавить допустим "Сохранить как" и "Заменить"?
Панель для редактирования доступна, но слева пусто...
Отв: Типичные ошибки распознавания - собираем статистику ...
Нет. В перечне доступных их нет.
Но снова рекомендую Вам "горячие клавиши". Тем более, что для "заменить" есть уже по дефолту - Ctrl+H.
Для "Сохранить как..." тоже есть, но я, например, изменила на удобную для себя комбинацию.
Кстати, все комбинации можно увидеть рядом с пунктами меню. А изменить их можно, как уже писал Wotti, через "Сервис -- Настройки -- Клавиши". Там есть и "навигация", и "просмотр", и "редактировать".
Отв: Типичные ошибки распознавания - собираем статистику ...
golma1 Про комбинации клавиш в курсе, хоть я и старой закалки, мышка меня разбаловала ;) А что мешает увеличить список доступных команд в следующей версии?.. но это так, мысли вслух.
Отв: Типичные ошибки распознавания - собираем статистику ...
К сожалению SeNS очень занят в реале и развитие ФБЕ остановилось на v2.6. Улучшения сейчас происходят за счёт новых скриптов Sclex-а (и модернизации старых скриптов) и большой работы по наполнению и улучшению функции проверки орфографии, которую проводит Shaman.
Но задумки по улучшению самой программы, его функционала - есть. SeNS обещал, как минимум, сделать панель работы с иллюстрациями.
Как он сам сказал - Так что, еще раз: *пробуем найти программиста!*
Отв: Типичные ошибки распознавания - собираем статистику ...
wotti Ясно. Жаль, а ведь как все начиналось...
TaKir А когда будет готова Ваша версия скрипта "Поиск по набору регэкспов"? Спрашиваю не из праздного любопытства - собираю книжную серию и прогоняю скриптами...
Отв: Типичные ошибки распознавания - собираем статистику ...
А там Выше Roxana выложила - это и есть сборка всего появившегося в последнее время на основе регэкспов Такира.
Отв: Типичные ошибки распознавания - собираем статистику ...
golma1 Так это версия не от Такира, а от Roxana, а я спрашиваю Такира, где можно скачать его последнюю версию после "Скрипт__TaKir_24_01_2011.zip", если она есть конечно...
Отв: Типичные ошибки распознавания - собираем статистику ...
Хэх... Даже не знаю, что Вам ответить. В-)
Ну да ладно, Такир сам ответит, если сочтёт нужным. ;-)
Отв: Типичные ошибки распознавания - собираем статистику ...
Дело в том, что Такир и сделал этот блог, для возможности обсуждения и добавления скрипта.
Этот скрипт, ув отличии от остальных - имеет возможность индивидуальной настройки.
Версия Такира входит в первоначально выложенную версию скрипта. Она минимальна и послужила основой этой темы, обсуждения и добавления . Т/е версия Роксаны, Голмы, wotti, и др. являются просто расширенной версией Такира. Для некоторых книг, в зависимости от особенностей я добавляю пару строчек, для других - закрываю слэшами пару-тройку ненужных в данной книге регэспов.
в общем этот скрипт может меняться не только у каждого юзера, но и у каждого файла. Скрипт Такира - базовый. Остальное - надстройки.
Отв: Типичные ошибки распознавания - собираем статистику ...
wotti Все это понятно и я не спорю - у каждого пользователя свои настройки... Просто хотелось начать плясать от "расписной" печки, а не от "буржуйки". Вы можете выложить свои настройки?
Отв: Типичные ошибки распознавания - собираем статистику ...
Они у меня без пояснений, так как у меня стоит 2.5-версия в которой они не показываются, а выкладывать их я не планировал.
Вы скажите какие именно вам нужны регеспы и, многие из отметившихся здесь, с удовольствием вам помогут их написать. А как вставить их в свой скрипт я уже описал))
Отв: Типичные ошибки распознавания - собираем статистику ...
Еще в копилку:
иди -> или
узе -> уж
пули -> пути
гам -> там
далее -> даже
Отв: Типичные ошибки распознавания - собираем статистику ...
фация - грация
узе -> уж
- отлично, можно сразу вставлять:
tagRegExp("(?<![а-яё])фация(?![а-яё])","i","Найдено: слово "фация" ("грация" с опечаткой).");
tagRegExp("(?<![а-яё])узе(?![а-яё])","i","Найдено: слово "узе" ("уж" с опечаткой).");
гам -> там тоже неплохо ( с некоторым допуском на ложные срабатывания)
tagRegExp("(?<![а-яё])гам(?![а-яё])","i","Найдено: слово "гам" ("там" с опечаткой).");
А вот
далее -> даже
пули -> пути
имхо создадут кучу холостых выстрелов)))
Отв: Типичные ошибки распознавания - собираем статистику ...
Согласна, но это как раз те случаи, которые можно отключать в зависимости от книги.
Отв: Типичные ошибки распознавания - собираем статистику ...
wotti Пояснения не актуально для меня - главное сочетания символов... - выложите, а там я разберусь и допишу подсказки... ;) Есть задумка свести данный топик воедино (может у Вас есть еще что добавить) и выложить здесь - для использования желающими...
Может кто в курсе - как реализовать поиск "... Слово" в начале параграфа?
(многоточие пробел Слово)
Отв: Типичные ошибки распознавания - собираем статистику ...
Я обычно ищу в режиме source, без регэкспов:
"<p>... "
Отв: Типичные ошибки распознавания - собираем статистику ...
RegExp
addRegExp("^[…] [а-я]","i","Найдено:многоточие в начале строки");
Отв: Типичные ошибки распознавания - собираем статистику ...
s_Sergius Если их много, да лучше удалить их все с помощью "Поиск и замена" в текстовом режиме... Но зачастую таких косяков очень мало, как и авторов любящих начинать абзац с многоточия. И часто я просто забываю проверить многоточие в начале абзаца.
golma1 Спасибо, завтра попробую подключить эту напоминалку...
Отв: Типичные ошибки распознавания - собираем статистику ...
В первой же книге нашел много ошибок, оказывается мало кто проверяет знаки препинания:
[collapsed title=открыть]
addRegExp("[!?.,:;][…]","i","Найдено:троеточие после знаков препинания...");
addRegExp("[.,:;][,]","i","Найдено:возможно ошибка синтаксиса");
addRegExp("[,:;][.]","i","Найдено:возможно ошибка синтаксиса");
addRegExp("[а-яё!-?»] […]","i","Найдено:троеточие пытается убежать");
addRegExp("[…][!-?]","i","Найдено:знаки препинания... после троеточия");
addRegExp("[а-яё] но ","i","Найдено: НО после слова без запятой, либо нужно ПО");
[/collapsed]
Поправьте, если что не правильно, или можно что еще добавить...
Еще в скрипт от Roxana можно добавить:
[collapsed title=открыть]
tagRegExp("(?<![а-яё])тою(?![а-яё])","i","Найдено: слово "тою" ("того" с опечаткой).","",1);
tagRegExp("(?<![а-яё])го(?![а-яё])","i","Найдено: слово "го" ("по или то" с опечаткой).","",1);
tagRegExp("(?<![а-яё])ои(?![а-яё])","i","Найдено: слово "ои" ("он" с опечаткой).","",1);
[/collapsed]
Отв: Типичные ошибки распознавания - собираем статистику ...
"гобой" --> "тобой"
tagRegExp("(?<![а-яё])гобой(?![а-яё])","i","Найдено: слово "гобой" ("тобой" с опечаткой).","",1);
Из "найдено буквы в пробелах" убрала "б" - слишком часто встречается в тексте.
addRegExp("[\\x20\\xA0\\t\\n\\r\\f][г,д,е,ё,з,й,л,м,н,п,р,т,ф,х,ц,ч,ш,щ,ъ,ы,ь,э,ю][\\x20\\xA0\\t\\n\\r\\f]","i","Найдено:буквы в пробелах");
Отв: Типичные ошибки распознавания - собираем статистику ...
"Б" действительно часто находилось, я как раз сегодня это обнаружил. Только запятые в регэкспе не нужны (а то будет находить запятую наравне с буквами), лучше просто:
addRegExp("[\\x20\\xA0\\t\\n\\r\\f][гдеёзйлмнпртфхцчшщъыьэю][\\x20\\xA0\\t\\n\\r\\f]","i","Найдено: буква между пробелами");
Отв: Типичные ошибки распознавания - собираем статистику ...
Ага, спасибо. :)
Отв: Типичные ошибки распознавания - собираем статистику ...
А чего он не ищет всякие "ххх- " (слово+дефис+пробел)?
Отв: Типичные ошибки распознавания - собираем статистику ...
??? У меня прекрасно ищет:
Отв: Типичные ошибки распознавания - собираем статистику ...
После OCR вместо И, П и Н часто появляется II. Записал в виде:
tagRegExp("(?![а-яё])II(?![а-яё])","i","Найдено: слово \"II\" (\"И\" с опечаткой).");
Правильно? Или возможен другой вариант?
Между знаками ? и ! должен стоять символ "<". Я убрал его, т.к. иначе строка не отображалась полностью. Почему-то.
Отв: Типичные ошибки распознавания - собираем статистику ...
Вообще-то это должно искаться другими регеспами
Отв: Типичные ошибки распознавания - собираем статистику ...
Ищется, когда имеется смесь латиницы с кириллицей. А если отдельно стоящий союз "И" - нет.
Отв: Типичные ошибки распознавания - собираем статистику ...
11 → Н
Отв: Типичные ошибки распознавания - собираем статистику ...
Поиск слов с двумя дефисами типа: как-ни-будь
tagRegExp("([a-zа-яё]-[a-zа-яё]*?-[a-zа-яё])","i","Найдено: слово в двумя дефисами).","",1);
у меня частенько заглавная буква \Л\ превращается в \JI\ (особенно в инициалах):
tagRegExp("(?<%![a-zа-яё])JI(?![a-zа-яё])","i","Найдено: \"JI\" (\"Л\" с опечаткой).");
УБРАТЬ ЗНАК %
Отв: Типичные ошибки распознавания - собираем статистику ...
Большое спасибо, очень полезные добавления.
Отв: Типичные ошибки распознавания - собираем статистику ...
Могу предложить для поиска слов с двумя дефисами и замены вот такой отдельный регесп:
([a-zа-яё])-([a-zа-яё]*?)-
в поле замены:
$1$2
Но нужно проверять - замена убирает дефисы вообще, так, что "ЗАМЕНИТЬ ВСЁ" здесь не пройдёт. Но мне удобно :))
Отв: Типичные ошибки распознавания - собираем статистику ...
А почему так сложно? И "i", по-моему, тут лишнее. Мы же только о верхнем регистре говорим, или?
У меня
tagRegExp("(JI)","","Найдено: ,буквы "JI" (возможно, Л).","",1);
тоже работает.
Я что-то упустила?
Отв: Типичные ошибки распознавания - собираем статистику ...
Ты права
Наверное нужно таки вставить впереди кириллицу и пробел
Отв: Типичные ошибки распознавания - собираем статистику ...
Нет, пробел не надо, а то в начале строки не выловит. Или?
А если кириллица, то сработает регэксп на "смесь кириллицы и латиницы".
Отв: Типичные ошибки распознавания - собираем статистику ...
Дело в том. что этот косяк у меня проявляется ТОЛЬКО в начале слова или в инициалах
Да бог с ним - я бывает и просто заменой меняю, если латинского нет в тексте
Отв: Типичные ошибки распознавания - собираем статистику ...
Угу, у меня тоже. Я именно для инициалов сделала. Но инициалы бывают и в начале строки. ;)
Отв: Типичные ошибки распознавания - собираем статистику ...
Заметил что в ФР11 при сохранении в ФИ2 картинки часто оформляются тегом table
А если картинок много - руками править не комфортно.
в режиме кода сделать масс-замену регеспом
найти:
(</table>)|(<table>|<td/>|<td/>|</tr>|<tr>|<th/>)
заменить на: ( ничего)
Удобно когда изображений много и идут блоками. как в сериях ЖЗЛ или в "Повседневная жизнь"
Отв: Типичные ошибки распознавания - собираем статистику ...
Спасибо. А то я их каждую массовой заменой удаляла. :(
Отв: Типичные ошибки распознавания - собираем статистику ...
Спасибо. А то я их каждую массовой заменой удаляла. :(
Отв: Типичные ошибки распознавания - собираем статистику ...
Cгорел комп и "всё, шо нажито непосильным трудом, — всё погибло"(с).
Программки нужные уже установил, но не хватает актуальных скриптов. Поделитесь, пожалуйста.
Отв: Типичные ошибки распознавания - собираем статистику ...
Поиск по набору регэкспов
http://minus.com/m74y1WFI0
Отв: Типичные ошибки распознавания - собираем статистику ...
Скачалось - «Ярлык для 17_Поиск по набору регэкспов.lnk» - 943 байт.
Отв: Типичные ошибки распознавания - собираем статистику ...
Сорри ступил:
http://www.multiupload.com/L2KTM7AE47
Отв: Типичные ошибки распознавания - собираем статистику ...
таки да. не скрипты это.
Отв: Типичные ошибки распознавания - собираем статистику ...
спасибо.
Отв: Типичные ошибки распознавания - собираем статистику ...
Перестал работать скрипт "Латиница в Кириллице". Подскажите в чем может быть проблема, плз.
Страницы