Вы здесь(OMG!) Координация сканирования и вычитки - черт ногу сломает
Опубликовано пн, 05/08/2013 - 15:26 пользователем Psychedelic
Когда у меня есть свободное время, я сканирую\распознаю\верстаю fb2. Насколько я понимаю ЦЕЛЬ этой фичи - в том, чтобы быстро найти книжную работу - сканировать, распознать, вычитать, исправить битый fb2 итп. с регистрацией того, кто будет ее делать, а также для того, чтобы не пересекались работы, т.к. чтобы Вася не делал ту же книгу, что делает сейчас Петя. Возможно конечно преследовались другие цели, к примеру ТОЛЬКО сбор статистики работы - тогда да (сарказм), этот функционал полностью покрывает цель, т.к. сколько я не рылся, я видел только одну статистику - кто че сделал. Итак подробно: Первая ошибка в том, что фильтр (значение "любое" на все колонки) находит людей которые: Ок, давайте поиграемся с фильтром. Моя цель найти: 1. Готовый скан 2. Электронный текст НЕ в книжных форматах (doc, rtf). Итак после 5 минут трехэтажных натягиваний нервов (т.е. методом тыка, не того результата и снова тыка), я наконец понял как найти нужное.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
Aliki RE:Подайте бедному копеечку на книжку с литреса... 9 часов
Larisa_F RE:Современная корейская литература. Книжная серия... 1 день kopak RE:На 78-м году жизни скончался советский и российский... 1 неделя Саша из Киева RE:Кто сможет раздобыть и оцифровать нужные мне книги? 1 неделя Саша из Киева RE:Подводное течение 1 неделя Larisa_F RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 1 неделя lemma7 RE:Серия «Интеллектуальный детектив» изд-ва АСТ 1 неделя konst1 RE:Переименовать ник (имя учетки) 2 недели Larisa_F RE:Таррин Фишер 1 месяц Aleks_Sim RE:Беженцы с Флибусты 1 месяц Саша из Киева RE:Как приобретать друзей и оказывать влияние на людей 1 месяц Isais RE:Семейственность в литературе 1 месяц miri.ness_ RE:Доступ 27 1 месяц bmusanov Оплатил, но абонемент не отображается 1 месяц holla RE:Багрепорт - 2 1 месяц konst1 RE:Файнридер для Win11 1 месяц larin RE:Оплатил, но абонемент не отображается 1 месяц sem14 RE:Книжная серия «Сlio» издательства "Евразия" 1 месяц Впечатления о книгах
vvv про Лекарская Академия
16 09 Плохо. Второму автору надоел инфантилизм первого, поэтому серию срочно свернули.
nik_ol про Донцова: Очень важный гость [litres] (Сказка, Детская проза, Детские остросюжетные, Детские приключения)
15 09 А что, новых детективчиков у Донцовой с июля, что ли нет? Только эти детские книжки?
mysevra про Митчелл: Унесенные ветром [Gone with the Wind ru] (Классическая проза, Исторические любовные романы)
15 09 Никогда бы не подумала, что буду читать взахлёб о Гражданской войне в США. Восхитительный роман! Главная героиня – что, пустышка, даже обидно за неё. Зато умеет замечательно выживать. «Я подумаю об этом завтра». А вот остальные ……… Оценка: отлично!
Adan75 про Блаватская: Письма из пещер и дебрей Индостана (Путешествия и география)
14 09 Это то что сейчас бы мы назвали тревел лог то есть заметки во время путешествия. Написано с большим юмором и вообще с самоиронией. Сильно изменило моё мнение о Елене Петровне вообще. Оценка: отлично!
obivatel про Найденов: Родовые земли [СИ] (Космическая фантастика, Самиздат, сетевая литература)
14 09 Автор не понимает как работают крупные структуры уровня государства. Понятно, что действия ГГ представлены схематично, но даже в этой схематичности видно, что он вообще даже представления не имеет о выбранной теме. Пока он ……… Оценка: плохо
udrees про Хитченс: Бог не любовь: Как религия все отравляет [god Is Not Great: How Religion Poisons Everything ru] (Религия)
13 09 Совершенно чумовая книга, обличающая всю неприглядную сторону религии и связанных с ней мифов, обычаев, заблуждений и кровавых эксцессов. Очень похожа на другую такую же великолепную книгу Ричарда Докинза «Бог как иллюзия», ……… Оценка: отлично!
udrees про Дубина: Путь нечисти (Городское фэнтези, ЛитРПГ, Самиздат, сетевая литература)
13 09 Писанина, любительская, примитивная и понятная. Сленг автора сквозит из каждого предложения и слова. Конструкции предложений тоже простые как три рубля – пошел, ударил, накачал. Обороты простые, речевые, вот примеры их: «Офигенски, ……… Оценка: плохо
udrees про Карелин: Шизанутый [СИ] (Постапокалипсис, Самиздат, сетевая литература)
13 09 Обычная средненькая по описанию книга в жанре литРПГ и попаданцев. Вся предыстория – это вначале несколько абзацев про то, как герой готовился к концу Света и его тут же переносит на 300 лет вперед. Написано примитивно, очень ……… Оценка: плохо
udrees про Макграт: Является ли «научное богословие» интеллектуальным нонсенсом? [диалог с Ричардом Докинзом] (Религиоведение, Публицистика, Христианство)
13 09 Слишком много словоблудия, непонятных словесных оборотов, щедро пересыпаемых богословскими рассуждениями ни о чем. Критика Докинза тоже на мой взгляд высосана из пальца. Аргументов я не увидел, только одни оправдания. Много ……… Оценка: нечитаемо
udrees про Трефил: Воображаемая жизнь. Путешествие в поисках разумных инопланетян, ледяных существ и супергравитационных животных [litres] (Научная литература: прочее)
13 09 Развлекательное чтиво, не особо серьезное, рассчитанное на массового читателя. Автор просто рассуждает в широком смысле – вот есть такие то планеты, как бы стали развиваться там не просто живые, а даже разумные существа. ……… Оценка: плохо
udrees про Виленкин: Мир многих миров: Физики в поисках иных вселенных (Физика, Астрономия и Космос)
13 09 Книга для любителей физики и интересующихся проблемами сотворения вселенной. В принципе автор пытался донести основные теории общедоступным языком, хотя понятия квантовой физики сами по себе очень тяжеловесны. По-моему Нильс ……… Оценка: неплохо
dolle про Михайлов: Пепел доверия 2 (Боевая фантастика, Постапокалипсис, Самиздат, сетевая литература)
13 09 Поклонникам Низшего, Перекрёстка, Астероид-Сити точно не понравится. Оценка: отлично! |
Комментарии
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
1) Оно, конечно, караул, но не караул-ужас-убивают. Гуманитарий (то бишь я) с двух пинков находит. Если не лень.
2) А варианты? Т.е. спасибо, что поделились эмоциями, но... других межсайтовых сервисов по информированию о верстке fb2 что-то не наблюдается. Будет где-то более удобная, дружелюбная и неглючная страничка с такой инфой - все будут ходить туда, http://lib.rus.ec/ocr тихо увянет; но пока же нет(?).
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Длинно как-то все.
Есть, наверно, минусы в координации. Почему бы не предложить решение по улучшению?
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Основная мысль сервиса: "я купил, покупаю, сканирую книгу. Ребята, если вам это интересно, то сообщаю об этом, можете не тратить деньги на эту же книгу, а купить другую. Но если вам нефиг делать, то покупайте такую же, фиг с вами, дублируйте мою работу". Деньги сэкономить и друг друга не дублировать - основная мысль. А по всем интересующим вас вопросам вы можете списаться в личку с человеком, нафигачившим статусы в карточке.
Отличный сервис, вообще-то. Чего не устраивает - не вкурил.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Хороший сервис, если разобраться:) Вообще можно поиграться ещё со ссылками напротив позиций: Книги в работе, Заказы, Статусы.
Например, нужны нулевые карточки без статусов. Смотрим позицию - Заказы, жмем, например, По поступлению и вуаля - http://lib.rus.ec/ocr/null
Получили список нулевых карточек. Можно и другие ссылки напротив позиции "Заказы" понажимать. Фильтры это для карточек со статусами.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Мысль хорошая, но этого не было в ТЗ при создании сервиса.
Обычно решалось и решается в личке. Без ОМГ и громких стенаний на форуме.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
А искать книги не в текстовых форматах для конвертации вообще не тут нужно. Они в книгах уже, и можно выбрать любой файл, скачать и конвертнуть. Если конечно его еще не конвертнули до.
Я в основном достаю и сканирую книги. И мне удобнее оставить статус, а не файл. Увидев статус Отсканировал, чел придет ко мне в личку и я адресно пошлю ему сканы. А не вывалю в пространство инета в надежде, что кто-нибудь когда-нибудь их возьмет в работу.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
1. Не надо вываливать куда-то. Нужно просто залить pdf\djvu (или на худой конец 7z пак с jpeg картинками, по размеру он еще меньше pdf) на либрусек в список книг автора - это в идеале.
Кстати ежедневно на либрусек заливается куча pdf книг. Найти их можно через поиск, логично и необходимо чтобы КСВ был связан с такими файлами. Человек интуитивно подразумевает связь с файлами сканов, когда видит КСВ.
Обращаться к кому то, чтобы выслали скан - это долго (пока человек прочитает, ответит, зальет - в среднем мин. сутки), у большинства свободное время есть сейчас, когда он зашел на либрусек, в поисках файла для работы (выходные например), вечером или завтра его уже может не быть.
А что с системой координации какая то другая надежда появляется? :) Все тоже - "в надежде что кто-нибудь когда-нибудь их возьмет в работу".
Понятно что КСВ+ файлы намного удобнее -- упорядоченная статистика с заявками + удобство работы и приоритеты (кто -то попросил вычитать fb2 или распознать pdf итп ) - чтобы работы не пересекались, иначе надежды нет.
Имхо тогда нужно написать так: Координация сканирования и вычитки (только статистика)..
Еще раз:
На данный момент эта фича реально полезна только тем, кто достает, они могут отследить заявки, выполнить их и отметиться - остальным же (сканировать\распознать\вычитать\сверстать) — только трата времени для добавления своей статистики в КСВ.
Трата - потому что средняя, ненаучная книга (с готового хорошего скана) делается за вечер (включая программную вычитку). Поэтому смысла регистрироваться на распознавание там нет.
Но КСВ служил бы хорошей системой для поиска приоритетных книг, которые нужно распознать\исправить (для поиска заявок).
P.s. Кстати, тот кто достает книгу, обычно ее и сканирует. Имхо пункты Достать\сканировать нужно объеденить, также как и пункты "могу достать" и "достаю".
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Я обычно сканирую книги, судьба которых мне не безразлична. Стало быть, если долго не найдется желающий забрать сканы, я сделаю их сама. Опять же, отдавая сканы одному человеку, я почти уверена, что книгу сделает он. Оставляя их в сети/библиотеке, я не знаю, кто их взял, взял ли кто. Многим (в т.ч. мне) лень отмечаться в карточках, так вполне возможна ситуация, что несколько человек скачают мои сканы и будут делать задвоенную работу. В общем, мне нравится так, как сейчас, с небольшими недостатками, но в целом все устраивает.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Напомню еще раз: в первую очередь, сервис создан для удобства и минимизации трат времени/денег сканировщиков, а не для тех, кто хочет "вотпрямщас" что-нибудь вычитать.
Чаще всего пдф остается сырым полуфабрикатом, потому-что книги на вычитку берут или уже распознанные, или в сканах. Перераспознавать пдф заново занятие бессмысленное и глупое. То-же самое можно сказать о выкладывании сырых пдф и сканов в библиотеку(откуда они обязательно расползутся по сети.) С таким же успехом можно выкладывать невычитанные фб2 болванки сразу из ФайнРидера...
Естественно я не имею в виду те книги которые предназначены для выкладки в пдф.
Если кто-то хочет вычитать книгу - он маякнет в личку. Нет - значит ему это не так важно.
К тому же в координации участвует много других библиотек, и существующий порядок вещей, может быть и неидеальный, всех устраивает. Делать все красиво и удобно лично для вас , никто не будет.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
+500!
Это была основной идеей, и она отлично работает.
Желающие конвертировать/вычитывать могут воспользоваться инструментами по закладке Статистика.
Выбрав тип файла, можно найти книги для конвертирования (если целесообразно).
Выбрав оценку файла, можно найти книги для вычитки.
Или заглянуть на Максиму:
Список запросов на конвертацию
Список запросов на вычитку
Файлы, как правило, в обеих библиотеках идентичные.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Я может вас удивлю, большинство сканов художки в pdf\djvu - это именно не распознанный pdf, в pdf его собирают для удобства - чтобы сканы были в одном файле, и все сканы можно быстренько смотреть.
Наоборот распознавать в худ книге текст сохраняя его в отдельном слое в контейнере pdf -- это глупое занятие если вы делаете так, не делайте, - вы тратите свое время.
Т.к. во первых этот распознанный текст все равно не вытащишь без слитых абзацев, потерянного курсива, жирности и сносок(FineReader во время распознавания сноски определяет автоматом, и сохраняет их в fb2 как сноски) .
Во вторых распознают его тяп-ляп, "по-бырику", полагаясь на автомат, без шаблонов обучения и подстройки под язык - короче с кучей ошибок.
Поэтому в любом случае (что со слоем текста, что без) pdf, будущий fb2\epub итп, все равно нужно распознавать.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Вы мне прямо глаза открыли...
Давайте я вас тоже удивлю. Текст из пдф можно не вытаскивать. Можно (та-даам!) прямо из ФР сохранить его в в любом другом формате с сохранением форматирования, курсивов, сносок и т.д. А пдф остается лишь подспорьем.
Впрочем, делайте так, как привыкли.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Ага-ага.
Сам Adobe Acrobat не может толково сохранить текст ИЗ pdf без искажений (абзацы), а все потому, что исходный текст (текстовый слой) там, как правило, делается полностью на автомате (без вычитки, без курсива и жирности, без размеров шрифтов и цвета.)
А нужен текстовый слой pdf для того (и он задумывался для этого), чтобы скопировать кусок текста в буфер.
Да кстати, даже если бы текстовый слой извлекался идеально, с курсивами без ошибок, без слитых абзацев, то остаются еще проблемы, который все перечеркивают -- сноски придется делать вручную, и главное - в текст добавляется нумерация страниц и колонтитул (надпись вверху-внизу с названием книги и автора). Искать их и удалять вручную оч. долго и нудно.
P.s. Сними галочку в FR с "Автоматически распознавать" - она по дефолту включена. Когда забрасываешь pdf он сразу анализируется и распознается (именно с картинки, не со слоя). Включи "Отключить анализ и распознавание".
Потом загрузи текстовый pdf и попробуй сохрани в текстовый формат и удивись в второй раз.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Дался вам этот пдф...
Мы, вроде, о сервисе координации говорили, не?