| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Алгоритмы > анализ строки адреса |
| Автор: dinaria 1.7.2011, 09:55 |
| Здравствуйте, нужно решить программно следующую задачу: 1) есть база плательщиков с адресами; единообразного заполения адреса нет, т.е. адрес может быть написан по-разному пример:Вышний Волочек,г.Вышний Волочек,КОТОВСКОГО,44 ; 2) мне нужно адресную строку разбить на следующие составляющие:район, населенный пункт, населенный пункт второго уровня,улица, дом, квартира;и загнать все это в dbf таблицу в соответствующими полями) в адресе всегда есть район, населенный пункт и дом, а населенный пункт второго уровня, улица и квартира могут отсутствовать) мне бы алгоритм, который бы все это делал)может кто-нибудь уже сталкивался с такой задачей) поделитесь опытом, пожалуйста) |
| Автор: nworm 1.7.2011, 11:14 |
| Это обычно вручную делают, если нужно точности достичь. Робот всё равно хоть раз да ошибётся. Причина - ошибки при вводе данных. Пожалуй лучший пример, Комск вместо толи Томск, толи Омск. И дальше надо по улицам и домам выверять. Роботы это в настоящее время не делают. Можно делать полуавтоматические системы с апрувингом. То есть после работы программы модератор всё проверяет. Дальше смотрите, какие разделители в тексте, обращаете внимание на Индекс (самое, видимо, хорошее поле). Ну и заносите всё в свою базу данных. |
| Автор: dinaria 1.7.2011, 13:10 |
| Спасибо за ответ)скорее всего буду делать нормализацию адресов) |
| Автор: _Y_ 4.7.2011, 12:07 |
Я делал нечто подобное для списков научных журналов: названия, годы издания, издатель, адрес издателя. Получился полуавтомат с немаленькой базой данных. Работал примерно так.
В Вашем случае есть проблема. У меня адресов было не так уж и много - сколько издательств столько и адресов. У вас же названий улиц может быть ну ооочень много. |