![]() |
|
Модераторы: korob2001, ginnie |
![]()
|
|
| Suppir |
|
|||
|
Опытный ![]() ![]() Профиль Группа: Участник Сообщений: 588 Регистрация: 20.4.2009 Репутация: нет Всего: нет |
Добрый день.
Написал программу, которая ищет опечатки. Она использует изначально словарь Word (прогоняет слова через движок Word'а), при этом создает собственный быстрый словарь. Но вот проблема - в текстах кроме опечаток очень часто встречаются фамилии, которые Word не знает: Иногородне-Малеваный Бувальцева Куцевол Фирстов Стукалова Найвирова Киркоровна Качарова Шпец Пермякова Свинухова Шибалкова Сосницкая Гутовская Боровская Рубайло Дербуш Головащенко Кисиль Галышева и т.д. Причем, видно же на глаз, что слова нормальные, в них нет ошибок. Я, вот, думаю, каким образом можно определить, что эти фамилии нормальные? Чтобы фамилии не захламляли лог с опечатками. Любые идеи приветствуются. |
|||
|
||||
| alezzz |
|
|||
![]() сплю... ![]() ![]() Профиль Группа: Участник Сообщений: 499 Регистрация: 17.8.2009 Репутация: 1 Всего: 14 |
так слова или фамилии? последнее обычно с большой буквы пишут, можно игнорировать по этому признаку, даже если в начале предложения. оффтоп: известность - это когда ворд не подчеркивает твою фамилию красным. Это сообщение отредактировал(а) alezzz - 2.6.2013, 19:30 |
|||
|
||||
| Suppir |
|
|||
|
Опытный ![]() ![]() Профиль Группа: Участник Сообщений: 588 Регистрация: 20.4.2009 Репутация: нет Всего: нет |
1) alezzz, программа проверяет юридические тексты на опечатки. Через Word каждый документ проверять сложно (речь идет о тысячах документов в неделю), поэтому нужно как-то "пакетно" проверять по всему массиву документов.
В программе уже есть опция "пропускать слова с большой буквы". Но при использовании этой опции "проскакивают" опечатки, которые идут в начале предложения и написаны с большой буквы. Возможно, стоит отсекать слова, написанные с большой буквы, которые стоят НЕ в начале предложения... Нужно попробовать. 2) Еще есть некоторая проблема определения топонимов: названий рек, поселков, деревень, которых также нет в словаре Word'а и которых существует огромное разнообразие. Пока не знаю, как это решить. Думал о таком методе: если опечатка в одной и той же форме повторяется, скажем, 10 раз, то это не опечатка. Но на деле выходит так: опечатку размножают по нескольким документам и программа пропускает ее, думая, что это нормальное слово. А какое-нибудь редкое (но правильное) слово, программа считает за опечатку. Это сообщение отредактировал(а) Suppir - 2.6.2013, 19:51 |
|||
|
||||
| DProf |
|
|||
|
Новичок Профиль Группа: Участник Сообщений: 39 Регистрация: 28.9.2012 Репутация: 1 Всего: 1 |
Может поискать какую-нибудь базу фамилий (телефонный справочник например взять) и по ней создать справочник собственный. Если нет слова в ворде, то в него лезть.
Этот ответ добавлен с нового Винграда - http://vingrad.com |
|||
|
||||
![]()
|
| Правила форума "Perl" | |
|
|
Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, korob2001, sharq. |
| 0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей) | |
| 0 Пользователей: | |
| « Предыдущая тема | Perl: Общие вопросы | Следующая тема » |
|
|
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности Powered by Invision Power Board(R) 1.3 © 2003 IPS, Inc. |