| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Python: Общие вопросы > найти частоту вхождения слов в текстовом файле |
| Автор: mrgloom 5.6.2012, 09:05 | ||||
читаю
как удалить запятые и точки и т.д.? как исключить предлоги? и как потом найти сколько раз встречается слово в списке? Добавлено через 11 минут и 2 секунды нашел такой код,работает, но не совсем, то что нужно.
|
| Автор: mrgloom 5.6.2012, 10:04 |
| ну могу заставить видеть русские слова в начале объявил # -*- coding: cp1251 -*- пробовал p = re.compile("\w+") p = re.compile("u'[а-яА-Я0-9-]+|[.,:;?!]+'") Добавлено через 1 минуту и 15 секунд так вроде заработало re.compile("[а-яА-Я0-9-]+|[.,:;?!]+") |
| Автор: Backward 5.6.2012, 10:24 | ||
Предлоги сами уберите. |
| Автор: mrgloom 29.10.2012, 11:19 | ||
| использую такой вот код, а как добавить исключающие слова? через re.compile?
|
| Автор: Carlos0N 3.11.2012, 23:23 | ||
Запятые и точки можно так к примеру убрать если не ошибаюсь
Убрать предлоги можно сравнивая слова со словарем, думаю тут сам справишься, т.к. составлять словарь из предлогов, а наверное ещё и союзов с частицами и междометиями мне лень. Есть правда куда более удобный способ - юзать pymorphy. Очень полезная библиотека для обработки текста. |