| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Perl: Общие вопросы > Текст |
| Автор: Bulat 13.9.2007, 15:51 |
| Постановка задачи проста, нужно определить на каком языке исходный текст. В голове крутится один корявый способ, но более пока ничего... |
| Автор: tishaishii 13.9.2007, 17:38 |
| А если на тарабарском и в тарабарском традиционном письме? В общем случае - ни как. Можно для каждого языка и наречия написать свой фильтр. |
| Автор: Bulat 13.9.2007, 17:43 |
| tishaishii, ну речь о тарабарском не идет. Речь идет хотя бы об самых распространненых языках. Европейская группа языков, азиатская по возможности, и конечно же русский, украинский и т.п. А ссылки или маны есть. Или по подробнее об этом P.S. По сути дела речь не идет о всех существующих языках, но хотя бы более или менее распространенные. |
| Автор: vadiml 14.9.2007, 22:33 |
| берутся словари нужных языков (напр. aspell), загоняются в базу или несколько хешей и по ним сличаются слова на наличие (на вхождение), С каким языком больше совпадений ... чем больше слов -- тем точнее результат есть одно НО -- в некоторых языках одну заковыристую букву могут обозначать 2-3 обычными буквами, например в немецком ss очень часто означает ß (но не всегда поэтому желательно иметь словари со всеми вариациями написания -- Есть еще один вариант -- посмотреть исходный код программы xneur ( http://xneur.ru/ ) там создаются словари недопустимых сочетаний (для 6 языков уже есть в программе) Такие словари получаются гораздо меньше размером, но если текст, на основе которого создается словари, мал, то будет много ошибок (похоже такая ситуация возникнет в v.0.8 с казахским языком, Андрей, который сейчас ведет эту программу, говорил что ему прислали всего 40+ КВ текста, а желательно 1-2 МВ, хотя может уже положение и исправили) |
| Автор: Bulat 1.10.2007, 14:53 |
| amg, уже заюзал, и не один, правда они чуток косячные... В итоге все свелось к он-лайн переводчику гугла, через проксю, работает не так быстро, но зато без косяков, по крайней мере пока |
| Автор: shamber 2.10.2007, 07:44 |
Bulat, всякие там людишки, писали, что Google в скором времени картиночку введут, так что готовися |
| Автор: Bulat 2.10.2007, 09:07 |
| shamber, это даже хорошо, а то знаешь ли, сниффер + перл + чуть-чуть мозгов, и даже скучно становится. Мой модуль с он-лайн переводчиком гугла строк 20, может 30 занимает... А так хоть какое разнообразие |