Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Perl: Общие вопросы > Текст


Автор: Bulat 13.9.2007, 15:51
Постановка задачи проста, нужно определить на каком языке исходный текст.

В голове крутится один корявый способ, но более пока ничего... smile 

Автор: tishaishii 13.9.2007, 17:38
А если на тарабарском и в тарабарском традиционном письме?
В общем случае - ни как. Можно для каждого языка и наречия написать свой фильтр.

Автор: Bulat 13.9.2007, 17:43
tishaishii, ну речь о тарабарском не идет. Речь идет хотя бы об самых распространненых языках. Европейская группа языков, азиатская по возможности, и конечно же русский, украинский и т.п.
Цитата(tishaishii @  13.9.2007,  17:38 Найти цитируемый пост)
Можно для каждого языка и наречия написать свой фильтр. 

А ссылки или маны есть. Или по подробнее об этом


P.S. По сути дела речь не идет о всех существующих языках, но хотя бы более или менее распространенные.

Автор: vadiml 14.9.2007, 22:33
берутся словари нужных языков (напр. aspell), загоняются в базу или несколько хешей и по ним сличаются слова на наличие (на вхождение), 
С каким языком больше совпадений ...

чем больше слов -- тем точнее результат

есть одно НО -- в некоторых языках одну заковыристую букву могут обозначать 2-3 обычными буквами, например в немецком ss очень часто означает ß (но не всегда smile )
поэтому желательно иметь словари со всеми вариациями написания
--
Есть еще один вариант -- посмотреть исходный код программы xneur  ( http://xneur.ru/ )
там создаются словари недопустимых сочетаний (для 6 языков уже есть в программе)
Такие словари получаются гораздо меньше размером, но если текст, на основе которого создается словари, мал, то будет много ошибок (похоже такая ситуация возникнет в v.0.8 с казахским языком, Андрей, который сейчас ведет эту программу, говорил что ему прислали всего 40+ КВ текста, а желательно 1-2 МВ, хотя может уже положение и исправили)

Автор: amg 18.9.2007, 06:28
Цитата(Bulat @  13.9.2007,  15:51 Найти цитируемый пост)
Постановка задачи проста, нужно определить на каком языке исходный текст.
http://search.cpan.org/~cog/Lingua-Identify-0.19/ и подобные модули.

Автор: Bulat 1.10.2007, 14:53
amg, уже заюзал, и не один, правда они чуток косячные... В итоге все свелось к он-лайн переводчику гугла, через проксю, работает не так быстро, но зато без косяков, по крайней мере пока smile Да и перевод у гугла лучше, чем у Бабелфиша, вроде большинство подобных модулей работают с ним smile

Автор: shamber 2.10.2007, 07:44

 smile 
Bulat, всякие там людишки, писали, что Google в скором времени картиночку введут, так что готовися smile
 smile 

Автор: Bulat 2.10.2007, 09:07
shamber, это даже хорошо, а то знаешь ли, сниффер + перл + чуть-чуть мозгов, и даже скучно становится. Мой модуль с он-лайн переводчиком гугла строк 20, может 30 занимает... А так хоть какое разнообразие smile

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)