Время и прогресс не стоят на места, особенно это касается сферы IT. Ещё, казалось бы, совсем недавно лишь закоренелый мазохист мог рискнуть отыскать смысл в машинном переводе. Однако в последнее время мы наблюдаем радикальные изменения в этом плане, и есть все основания предполагать, что в ближайшем будущем ситуация продолжит стремительно улучшаться. Наиболее вероятно, что через два-три года надобность в Рулейте и вовсе отпадёт. По крайней мере, в его текущем виде - с тотальным засильем полуграмотных проходимцев, выдающих себя за переводчиков. Для выживания ему придётся или ощутимо поднять планку качества, или кануть в Лету. Действительно, обычному читателю ранобе, привычного к созерцанию текста, который практически не испытал вмешательства "переводчика", ему нету никакого резона ожидать продолжения понравившейся книги, когда в любой момент - бери, открывай один из многочисленных англоязычных сайтов и читай через Гугл, получая практически то же самое. Уже сейчас вовсю набирает размах данная тенденция. Мир меняется. И владельцы сайтов, аналогичных этому, могут либо и далее прятать голову в песок, либо же поразмыслить, каким образом измениться, дабы предоставляемый ими спектр услуг оказался востребованным. А то и суметь возвыситься, став первым, кто сможет удовлетворить запросы, соответствующие новым реалиям. Прежде, чем перейти к конкретике, расскажу немного предыстории и личного опыта. Слушал я как-то некую книгу, закончились переведённые главы, попробовал Гугл (закидывая через одну программу сразу по 10 глав) - оказалось в целом нормально, но некоторые однотипные косяки сильно мозолили глаза. Например "ремесленник" отображался как "фальсификатор". Тут я вспомнил, что в этой же программе также имеется функционал словарей коррекции произношения, действующих по принципу производимой "на лету" автозамены одного текстового фрагмента на другой. Почему бы не попробовать? Сказано - сделано. Всё оказалось совсем просто: выделение фразы, правый клик, небольшая правка - готово. На одно правило уходит секунд 5-10. Таким образом, создав несколько правил для разных падежей и склонений, проблема оказалась решена и можно было продолжить чтение. Потом встретился ещё косяк и ещё... в общем, на данный момент уже существует несколько словарей, которые содержат 2000+ правил. Один - default, второй - убирает мат, иногда заменяя более культурными аналогами, третий же призван бороться с японщиной - вычищает имена ото всех этих "санов", "кунов" и бессмысленных наборов букв. Четвёртый ликвидирует последствия вмешательства в Гугл быдлопереводчиков - всяческие плебейские "по факту" вместо "фактически", "че болтаешь ерунду" вместо "не говори глупостей", "типа тебя" - "вроде тебя", "имхо" - "я полагаю". Пятый убирает текстовой мусор - неуместные символы, имена переводчика и редактора, откуда взят текст и т.д. Шестой менее универсален, т.к. содержит имена собственные, названия заклинаний, городов и тому подобного, кои имеют прямое отношение к конкретному произведению. Зачем? Гугл почему-то иногда переводит их, а иногда оставляет оригинал, что вносит хаос и сбивает с толку. Из него подлежат повторному использованию разве что названия заклинаний и "техник", вроде каких-нибудь "Silent Steps" и "Fireball", "Fire arrow". Примерно такую же систему я и предлагаю реализовать на данном сайте. Почему это имеет смысл:
1. Раз народ уже активно практикует чтение через Гугл, причём тенденция всё увеличивается, если здесь ему предложат то же, но в более удобном виде, а главное, сам перевод (по мере наполнения общей базы правил) начнёт демонстрировать всё более высокое качество, - то люди сюда потянутся.
2. Практически каждое правило автозамены - вещь не (!) одноразовая, а универсальная. Особенно это касается фраз из двух-четырёх слов. Сделал один раз - работает везде и всегда. Почему так? Тому способствует сама специфика ранобе, содержащего ограниченный набор устоявшихся выражений, каждое из которых имеет однозначное трактование. С обычной книгой, ввиду огромного разнообразия слога, этот номер ещё слишком трудоёмок, но для ранобе прекрасно подходит.
3. Сколь бы ни были велики старания, направленные на перевод одной конкретной книги, в итоге весь труд окажется целиком заключён в одном-единственное произведение. Здесь же каждый вклад отдельного человека приближает к идеалу универсальную систему, применимую ко множеству других произведений, которые тем ещё лишь предстоит прочесть. Каждое усилие людей продолжит жить и будет востребовано. По мере пополнения базы правил, текст станет ощутимо преображаться в лучшую сторону. Всё сводится лишь к её обширности. Более того, если к делу приложат руку люди, которые близко знакомы с полноценной литературой, текст на выходе может получиться куда лучше среднестатистического с Рулейта.
4. Если лично для меня эта схема уже вполне успешно работает, то каков же будет результат, если в деле примут участие 100? Или 1000 людей? Здесь уже не раз звучали просьбы о введении отдельных элементов этой системы: начиная с ручной правки косяков перевода (что, впрочем, малопродуктивно) до упрощённой версии автозамены. Например, предоставить возможность сменить испанских "синьоров" на китайских "старейшин" в произведении о "культиваторах".
Несколько замечаний:
1. Для успешного функционирования данной системы необходимо привлечь как можно больше активного народу. Они же, в свою очередь, гораздо охотней проявляют энтузиазм, когда читают то, что им нравится, а не что дают. Необходимо изменить политику сайта, дабы любой человек мог добавить понравившееся ранобе по ссылке, а сайт спарсит его и оформит в текст для дальнейшей обработки. Естественно, должен быть периодически пополняемый список сайтов, под которые имеются парсеры.
2. В простейшем виде, думаю, реализовать будет несложно, но вот доведение до ума и совершенствование - определённо отнимет уйму сил. И, в то же время, станет барьером на пути возможным конкурентам, ведь кому из читателей будет охота наполнять базу с нуля, если уже имеется частично готовый вариант.
3. Инструментарий и UI должны быть хорошо продуманы и максимально удобны, дабы не отбивать своей корявостью желание людей вносить свой вклад.
4. Необходимы гарантии со стороны администрации, что результат труда народа не будет однажды ими присвоен, мол "оформите премиум-подписку для чтения доработанного перевода" и т.д. Впрочем, такой шаг сразу отпугнёт энтузиастов и остановит наполнение базы. А её рост будет необходим всегда.
Примерная схема работы:
1. Парсинг текста на английском. Сохранение.
2. Осуществление автоперевода. Сохранение. (Возможно, с задействованием браузеров пользователей в качестве прокси, что сильно снизит вероятность временного бана от Гугла, а также предусмотреть проверку, не превышен ли лимит - когда Гугл станет возвращать оригинальный текст и/или ругаться капчей).
3. Динамическое сведение всех правил в единый словарь и применение его к открытой пользователем главе, сохранённой в п.2. Важный момент: данное действо должно осуществляться каждый раз, если произошло какое-либо изменение в словарях.
4. Выдача модифицированной главы по запросу пользователя (когда тот "перелистнул страницу").
Замечания:
1. Алгоритмы Гугла периодически совершенствуются, поэтому п.2 нужно будет повторять, скажем, раз в три месяца. Например, недавно "культиваторы" стали "самосовершенствующимися".
2. По мере появления новых глав в открытом доступе (Рулейт) и т.д. - использовать их в качестве основы для дальнейшей обработки. Исключение можно делать лишь для тех произведений, которые переводил воистину мастер своего дела.
Пускай я и забегаю наперёд, но всё же дам пару практических рекомендаций, которых нужно придерживаться при наполнении словарей:
1. След всячески избегать использования одного-единственного слова в качестве того, что след заменить. Исключение - если оно абсолютно не вписывается ни в какой расклад и всевозможные сеттинги. Например "эскадрон" -> "отряд" либо "команда", "кемпинг" -> "лагерь".
2. Всё на 95% сводится к выделению из предложения минимальной логической связки слов, несущей конкретный смысл и её замене на соответствующий словесный оборот, свойственный для данного языка. Примеры: Небо было ясным и ясным - Небо было ясным и безоблачным, значительно выровнялись - значительно повысили свои уровни, скорость выравнивания - скорость повышения уровня, взлетами и падениями жизни - жизненными пертурбациями, который эхом отразился - отразившийся эхом, имели значительное качество - отличались высоким качеством, в тихих тонах - вполголоса, после нашей еды - после того, как поедим, перед лицом абсолютной власти - пред лицом подавляющей силы, словно организуя язык - словно подбирая слова, подавленную и подавленную атмосферу - мрачную и гнетущую атмосферу. Есть несколько менее практичные в плане повторного использования, но добавленные мною ради стремления к совершенству: это было не то, что можно было получить в лоб - было неразумно напрямую противостоять такой атаке, Я ударил золото на этот раз! - На сей раз я выиграл джек-пот!, доказывают, что произошло только сейчас - являются доказательством только что произошедшего, Рассветный солнечный свет сиял в спальне - Первый луч рассвета коснулся спальни, Все, что я говорю, на самом деле является спекуляцией - Всё мною сказанное является лишь предположением, Дул холодный, но холодный северный ветер - Дул холодный и пронизывающий до костей северный ветер, С устойчивыми и сильными шагами - Размашистым твёрдым шагом, Когда гигантский день просто сместился на запад - Когда солнце этого долгого дня стало понемногу клониться к закату, после того, как его голос упал, на месте никто не был открыт - после того, как стихло эхо его голоса, никто не произнёс ни звука, был взволнован его сильным любопытством - чувствовал волнение и был полон любопытства. Надеюсь, этого достаточно для понимание общих принципов. Итого имеем три аспекта: ликвидация назойливых косяков, лёгкое "причёсывание" текста и доведение до идеала (для перфекционистов).
3. Когда ты нашёл фразу и уже придумал ей замену, обязательно возьми небольшую паузу и задайся вопросом - является ли смысл изначальной фразы абсолютно однозначным? И не может ли у неё быть иного значения? Если да - оставь всё как есть.
4. Важный момент относительно того, как именно применяются правила автозамены. Предположим, имеется фраза "Мысль о некоторых вещах, но все это очень грязно", которую след заменить на "Есть парочка идей, но над ними ещё нужно как след поразмыслить". Так вот, если кто-то создаст ещё одно правило для части фразы "Мысль о некоторых вещах" и передвинет его в очерёдности выше, то сработает лишь это правило, а приведённое выше - навсегда окажется не у дел. Поэтому нужно предусмотреть алгоритм, отслеживающий такие случаи и вовремя предупреждающий пользователя с предложением изменить очерёдность на не вызывающую подобных конфликтов. А также пометив правило для дальнейшей проверки специализированным модератором.
Пара заметок к реализации:
1. Предусмотреть вариативность, когда фразу можно заменить на один из нескольких аналогов, выбранных случайным образом.
2. Предусмотреть индивидуальную настройку для конкретного пользователя. Вдруг он не захочет подключать словари, убирающие мат или японских "санов" с "кунами".
3. Предусмотреть вариант, когда заменяемый фрагмент являет собою начало предложения и, соответственно, должен быть оперативно модифицирован, дабы первая буква стала прописной (фраза начиналась с большой буквы).
4. Предусмотреть вариант создания правила, когда заменяемая фраза имеет внутри разрыв в одно-два слова, которое может быть произвольным. К примеру, она может содержать имя персонажа. Как-то так: слово1 слово 2 Имя слово3 слово4.
5. Инструментарий должен содержать функцию быстрого поиска и отображения схожих словоформ. Это в дальнейшем сильно сэкономит время и усилия энтузиастов, ведь проще один раз отработать все найденные падежи и склонения, вроде "фальшивомонетчик(у/а/ом/ам)" - "ремесленник(у/а/ом/ам)", нежели раз за разом натыкаться на, вроде бы, только что исправленное.
6. Крайне желательно задействовать более знакомых с полноценной литературой людей, дабы те иногда правили "творчество" остальных пользователей.
Прежде, чем перейти к конкретике, расскажу немного предыстории и личного опыта. Слушал я как-то некую книгу, закончились переведённые главы, попробовал Гугл (закидывая через одну программу сразу по 10 глав) - оказалось в целом нормально, но некоторые однотипные косяки сильно мозолили глаза. Например "ремесленник" отображался как "фальсификатор". Тут я вспомнил, что в этой же программе также имеется функционал словарей коррекции произношения, действующих по принципу производимой "на лету" автозамены одного текстового фрагмента на другой. Почему бы не попробовать? Сказано - сделано. Всё оказалось совсем просто: выделение фразы, правый клик, небольшая правка - готово. На одно правило уходит секунд 5-10. Таким образом, создав несколько правил для разных падежей и склонений, проблема оказалась решена и можно было продолжить чтение. Потом встретился ещё косяк и ещё... в общем, на данный момент уже существует несколько словарей, которые содержат 2000+ правил. Один - default, второй - убирает мат, иногда заменяя более культурными аналогами, третий же призван бороться с японщиной - вычищает имена ото всех этих "санов", "кунов" и бессмысленных наборов букв. Четвёртый ликвидирует последствия вмешательства в Гугл быдлопереводчиков - всяческие плебейские "по факту" вместо "фактически", "че болтаешь ерунду" вместо "не говори глупостей", "типа тебя" - "вроде тебя", "имхо" - "я полагаю". Пятый убирает текстовой мусор - неуместные символы, имена переводчика и редактора, откуда взят текст и т.д. Шестой менее универсален, т.к. содержит имена собственные, названия заклинаний, городов и тому подобного, кои имеют прямое отношение к конкретному произведению. Зачем? Гугл почему-то иногда переводит их, а иногда оставляет оригинал, что вносит хаос и сбивает с толку. Из него подлежат повторному использованию разве что названия заклинаний и "техник", вроде каких-нибудь "Silent Steps" и "Fireball", "Fire arrow".
Примерно такую же систему я и предлагаю реализовать на данном сайте. Почему это имеет смысл: