Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Сервисы и программы для работы с SE > Программка определения позиций сайта


Автор: Platon 5.8.2008, 20:06
Здравствуйте, уважаемые.

Решил представить вашему вниманию небольшую программку для определения позиций сайта по ключевым словам среди известных поисковиков (google.com, google.ru, yandex.ru)

Прошу оценки, предложения, идеи.

http://web-mastery.info/sespider/distr/SESpider-v0.5.21.rar (2.7 Мб)
или
http://web-mastery.info/sespider/distr/SESpider-v0.5.21u.rar (200 кб)

Описание:

- 9 российских и зарубежных поисковиков, в их числе отечественные - Google.ru, Yandex.ru, Rambler.ru, Mail.ru; зарубежные - Google.com, Google.com.ua, Google.lv, Yahoo.com, Live.com
- 2 алгоритма поиска позиций
- 4 языка (английский, русский, латышский, украинский)
- выход в интернет через proxy
- защита IP от бана (капча)

1-е окно:
3 колонки (Ключевые слова, Сайты, Поисковые машины), первые 2 активно редактируются, поисковые машины пока строго 3 (Google.com, Google.ru, Yandex.ru)
Есть параметр глубины поиска, (задается в позициях)
Параметр одновременной работы нескольких загрузок страниц.

В формировании запроса могут участвовать несколько ключевых слов, сайтов и поисковых машин.

http://ipicture.ru/

2-е окно - процесс поиска.
Таблица, колонки  - поисковые машины, ряды - ключевые слова для выбранного сайта из списка сайтов внизу.
Кнопочка остановить.
Включение/выключение отображения предыдущей/лучшей позиции.
Сохранение результатов поиска.

http://ipicture.ru/

При двойном клике на позиции сайта высвечивается информация о найденной странице: содержимое тега заголовка страницы, и описание релевантного куска текста
http://ipicture.ru/

История сканирования. Выбор даты, появляется список сайтов, при выборе сайта выводятся позиции.
http://ipicture.ru/

Настройки частоты запросов к поисковику
http://ipicture.ru/

Последнее описание возможностей и скриншоты http://platon007.blogspot.com/2008/08/blog-post.html

Автор: Str!pe 5.8.2008, 21:41
А как его запускать? 

Автор: Platon 6.8.2008, 08:57
Это Java программа, нужно установить Java Runtime Environment.

Ссылкак на страницу с загрузками: http://java.sun.com/javase/downloads/index.jsp Выбрать Java Runtime Environment

Или прямая ссылка: https://cds.sun.com/is-bin/INTERSHOP.enfinity/WFS/CDS-CDS_Developer-Site/en_US/-/USD/ViewProductDetail-Start?ProductRef=jre-6u7-oth-JPR@CDS-CDS_Developer
Около 15Мб

Автор: Platon 7.8.2008, 14:10
Обновил до версии 0.3.0

Автор: Platon 8.8.2008, 10:23
Обновил до версии 0.3.1

Автор: Platon 8.8.2008, 23:41
Обновил до версии 0.3.2

Автор: Str!pe 9.8.2008, 00:31
Что нового то?

Автор: Platon 9.8.2008, 08:55
В блоге описан changelog.

Автор: Platon 11.8.2008, 20:34
ну хоть бы кто мяукнул?

Автор: UniBomb 11.8.2008, 21:42
вот мой мяу:

Я так понял во втором окне число показывает место сайта на странице с найденным... Что тогда значит просто число "8"? Почему без плюсиков/минусиков, без скобочков (не так многозначительно как на картинке)?

А с точки зрения юзверя - почему бы не сделать всё един окошком?

А так всё супер (непонятно что конкретно, но точно супер))))

Автор: Str!pe 11.8.2008, 23:02
1. почему ключевые слова добавляются через новое окошко? Зачем плодить окна?
2. про сайты то же самое.
3. Кнопка пуск нажимается, но ни чего не происходит. Win XP SP3

Добавлено через 56 секунд
Понял юмор, сначала надо выделить слова, поисковики и сайты по которым искать... а если у меня пара сотен слов н каждый сайт?

Добавлено через 1 минуту и 53 секунды
задал сайт без www (в индексе он с www) не нашла софтина.

Добавлено через 9 минут и 57 секунд
А как просмотреть результаты повторно без повторного парсинга?

Автор: Platon 12.8.2008, 09:15
Цитата(Str!pe @  12.8.2008,  00:02 Найти цитируемый пост)
а если у меня пара сотен слов н каждый сайт?

Больше времени на поиск просто займет, а какие проблемы?


Цитата(Str!pe @  12.8.2008,  00:02 Найти цитируемый пост)
задал сайт без www (в индексе он с www) не нашла софтина.

Окэй, разберемся


Цитата(Str!pe @  12.8.2008,  00:02 Найти цитируемый пост)
А как просмотреть результаты повторно без повторного парсинга? 

Есть кнопочка на главном окне "История анализа"

Добавлено через 4 минуты и 16 секунд
Цитата(Str!pe @  12.8.2008,  00:02 Найти цитируемый пост)
задал сайт без www (в индексе он с www) не нашла софтина.

У вас последняя версия?

Добавлено через 7 минут и 7 секунд
Или возможно наоборот, вы задали http://www.tra-ta-ta.ru, и ничего не нашло?

Автор: Platon 12.8.2008, 09:31
Цитата(UniBomb @  11.8.2008,  22:42 Найти цитируемый пост)
А так всё супер (непонятно что конкретно, но точно супер)))) 

За это конечно спасибо ^_^


Цитата(Str!pe @  12.8.2008,  00:02 Найти цитируемый пост)
1. почему ключевые слова добавляются через новое окошко? Зачем плодить окна?

Цитата(UniBomb @  11.8.2008,  22:42 Найти цитируемый пост)
А с точки зрения юзверя - почему бы не сделать всё един окошком?


ваши предложения в картинках

Цитата(UniBomb @  11.8.2008,  22:42 Найти цитируемый пост)
Я так понял во втором окне число показывает место сайта на странице с найденным... Что тогда значит просто число "8"? Почему без плюсиков/минусиков, без скобочков (не так многозначительно как на картинке)?


Да, наверно вам трудно понять тайный замысел окраски, и цифорок в скобочках.
Накидаю небольшое появнение:

xx -/+ yy (zz)

xx - текущая позиция сайта
yy - изменение по сравнению с прошлым анализом
zz - лучшая позиция за историю поиска

Если yy = 0 он просто не выводится, ясно понятно, что стрелочка тоже указывает в консонансе со значением yy и не выводится, если позиция не изменилась
Если предыдущего поиска еще не было, то лучшей позиции еще нет, поэтому она также не выводится

Красным текстом выводится позиция, которая >= лучшей позиции за историю поиска, серым - все остальные позиции, даже если сайт показывает положительный yy

Автор: Platon 12.8.2008, 10:00
Обновил до 0.3.3

Автор: Platon 12.8.2008, 11:05
А вообще меня волнует поведение google.ru
google.ru почему-то выдает результаты не на той позиции, на которой вижу в браузере. что влияет на вывод? User-Agent? cookie? или что-то еще?

Добавлено @ 11:07
Точнее иногда зашкаливает позицию чуть ли не на Top10, хотя реально на позиции 44-46, через некоторое время SESpider анализирует так как надо.

Автор: UniBomb 12.8.2008, 13:18
Цитата(Platon @  12.8.2008,  09:31 Найти цитируемый пост)
ваши предложения в картинках

Ну ты помни, что критиковать всегда проще  smile 

В общем вот:

http://ipicture.ru/Gallery/Viewfull/5426829.html


ЗЫ: это так... просто предложение....

Автор: Platon 12.8.2008, 13:51
Обновил до версии 0.3.4

Автор: Str!pe 12.8.2008, 16:38
Цитата(Platon @  12.8.2008,  10:15 Найти цитируемый пост)
Больше времени на поиск просто займет, а какие проблемы?

Проблема в юзабилити, это все забивать и каждый раз это все выбирать по новому для каждого сайта.
Цитата(Platon @  12.8.2008,  10:15 Найти цитируемый пост)
У вас последняя версия?

была да.
Цитата(Platon @  12.8.2008,  12:05 Найти цитируемый пост)
google.ru почему-то выдает результаты не на той позиции, на которой вижу в браузере. что влияет на вывод? User-Agent? cookie? или что-то еще?

И он, и смотря откуда ты парсишь... Через прокси парсишь?

Автор: Platon 12.8.2008, 17:15
Цитата(Str!pe @  12.8.2008,  17:38 Найти цитируемый пост)
Через прокси парсишь? 

А вот это, кстати, фича, которую надо бы проработать. Пока работа идет без прокси. Браузер и программа выходят одинаковым способом. FireFox и Opera показывают одинаковые результаты.


Цитата(Str!pe @  12.8.2008,  17:38 Найти цитируемый пост)
Проблема в юзабилити, это все забивать и каждый раз это все выбирать по новому для каждого сайта.

забивать ведь 1 раз, при следующем открытии всё восстанавливается.
Другое дело ставить галочки, это да, тоже нужная фича.

А что подразумевается под для каждого сайта? Т.е. выбрал сайт из списка и автоматически выбрались нужные поисковики и нужные ключевые слова?

Автор: Str!pe 12.8.2008, 18:08
Цитата(Platon @  12.8.2008,  18:15 Найти цитируемый пост)
Т.е. выбрал сайт из списка и автоматически выбрались нужные поисковики и нужные ключевые слова?

да, можно проекты хранить в отдельном файле и просто подгружать нужные данные для парсинга.

Автор: Platon 12.8.2008, 18:23
Ок, над этим можно подумать...

Автор: Platon 12.8.2008, 18:45
Обновил до версии 0.3.5

Автор: Platon 14.8.2008, 16:46
Обновил до версии 0.3.6

Автор: Platon 15.8.2008, 14:48
Обновил до версии 0.3.7

Автор: Platon 18.8.2008, 15:58
Обновил до версии 0.3.8
+ Многоязычный интерфейс

Автор: Platon 19.8.2008, 10:36
Обновил до версии 0.3.9
  - Яндекс поменял формат вывода данных, изменение учтено

Автор: Platon 19.8.2008, 13:47
  - Гугл.ру Гугл.ком: не все позиции подходили под шаблон
  - Потоковый метод обработки страницы (если сайт находится в начале страницы, то он будет найден до того, как вся страница будет загружена)

Автор: Platon 20.8.2008, 18:30
Обновил до версии 0.3.10
  - Нашел неточности в шаблоне обработки результатов Яндекса, исправлено

Автор: Platon 20.8.2008, 19:01
  - Гугл сменил формат вывода, приведено в соответствие

Автор: Platon 21.8.2008, 15:05
Обновил до 0.3.11
  + Yahoo.com и Live.com в команде

Автор: Str!pe 22.8.2008, 17:00
Цитата(Platon @  19.8.2008,  14:47 Найти цитируемый пост)
  - Гугл.ру Гугл.ком: не все позиции подходили под шаблон

Там скачки ежечасно, так что не всегда глаза подводят smile

Автор: Platon 24.8.2008, 17:46
скачки по позициям? нет я имел ввиду, что из 10 страниц может распознать 7, от того, что есть вложенные результаты.

Так. Тут такая тема всплыла. Работая с подобными автоматизированными программами, можно получить временный бан от поисковой системы за частое автоматизированное обращение к ней. Можно узнать поподробней допустимую частоту запросов - количество запросов в серии, пауза между сериями запросов  и прочее...

Автор: drkot 26.8.2008, 23:01
Цитата(Platon @ 19.8.2008,  13:47)
- Гугл.ру Гугл.ком: не все позиции подходили под шаблон
  - Потоковый метод обработки страницы (если сайт находится в начале страницы, то он будет найден до того, как вся страница будет загружена)

а смысл?
обработка парсером занимает доли секунды

Добавлено через 2 минуты и 20 секунд
Цитата(Platon @  24.8.2008,  17:46 Найти цитируемый пост)
нет я имел ввиду, что из 10 страниц может распознать 7, от того, что есть вложенные результаты.

Значит выражение неправильно составил

Добавлено через 3 минуты и 40 секунд
Цитата(Platon @  21.8.2008,  15:05 Найти цитируемый пост)
Обновил до 0.3.11

однако быстро развивающийся проект smile
у меня за год только пара циферок поменялась smile

Добавлено через 7 минут и 17 секунд
Цитата(Platon @  24.8.2008,  17:46 Найти цитируемый пост)
можно получить временный бан от поисковой системы за частое автоматизированное обращение к ней.

а ты что этого не ожидал?

Автор: Platon 27.8.2008, 07:32
Цитата(drkot @  27.8.2008,  00:01 Найти цитируемый пост)
а смысл?
обработка парсером занимает доли секунды

У меня выход в интернет на скорости 6 кб/с, при этом параллельно идет кач мувиков, визуальное ускорение ощутимо, поверьте.


Цитата(drkot @  27.8.2008,  00:01 Найти цитируемый пост)
Значит выражение неправильно составил

не неправильно, а не учел дополнительных вариантов.


Цитата(drkot @  27.8.2008,  00:01 Найти цитируемый пост)
однако быстро развивающийся проект smile
у меня за год только пара циферок поменялась smile


так циферка 3-го порядка. Тем более циферки устанавливаются каждым по-разному, и на сколько я знаю, жестких рамок нет, главное, чтобы люди понимали важность (вес) релиза.


Цитата(drkot @  27.8.2008,  00:01 Найти цитируемый пост)

а ты что этого не ожидал?


Честно сказать, нет. Иначе бы учел. Сам я ни разу под бан не попадал, так что прошу опытных СЕОшников подсказать когда у них случаются баны? как часто и в каких количествах надо обращаться к поисковику?  smile 

ЗЫ: научите ребенка безобразничать!  smile 

Автор: Platon 28.8.2008, 20:16
Возвращаюсь к разработке программки.

Планирую ввести новый функционал. Жду предложений.
На повестке:
* графическое представление позиций сайта
* попроектная структура
* выход в интернет через прокси.

Вопросы:
- какими графическими данными оперировать? 
--- координатная система "ключевое слово" - сайт -> дата/позиция
--- еще какие?

- что хранить в проекте? 
--- список исследуемых ключевых слов, сайтов?
--- надо ли хранить проектонезависимый список ключевых фраз и сайтов из которых формируются проетные списки? в дальнейшем позволит делать межпроектные отчеты.
--- еще какие?


- ваши предложения?
--- нужно ли PR, тИЦ
--- зарегистрированность в каталогах
--- прочая стандартная и не очень фишка.

Автор: Platon 4.9.2008, 08:05
Обновил до версии 0.3.12

 - исправлен шаблон Yandex.ru

Автор: Platon 4.9.2008, 08:25
Встала более приоритетная задача: избегание капчи.
Т.к. я ее не видел, и похоже не увижу в ближайшее время из-за недостижимости по скорости интернета.
Я вижу решение сделать для каждого поисковика по 3 параметра: число серии запросов, период за который считается число серии запросов, время задержки между двумя сериями, которые могут регулироваться пользователем...

Автор: Platon 4.9.2008, 12:58
- раз все спрашивали про капчу, сделал капчу.
На откуп мастерам настраивать можно самостоятельно.
По умолчанию сделал "выполнять запросы раз в секунду с 30% отклонением"
3 параметра:
1. Число запросов в серии (друг за другом без паузы)
2. Период, в который должна укладывается серия запросов
3. Пауза на остывание, если запросов в серии больше, чем задано в пункте 1

Автор: Platon 5.9.2008, 14:58
Рад сообщить о выхоже версии 0.4.0
- попроектная структура работы
- пакетное добавление ключевых фраз

Автор: Platon 18.9.2008, 10:21
0.4.4
-Yandex.ru сменил формат вывода, приведено в соответствие.
- Mail.ru сменил формат вывода, приведено в соответствие.
  + Для красивости добавил иконок поисковиков.
0.4.5
  - Сменил алгоритм предотвращения капчи (2 параметра - число запросов в серии, период серии
  + Для красивости добавил возможность логотипа сайта (favicon)

http://ifolder.ru/8176622 (1.48 Мб)
или
http://ifolder.ru/8176636(155.14 кб)

Автор: Str!pe 18.9.2008, 21:02
Platon, хороший софт пишешь! Нужная вещь.

Автор: Platon 19.9.2008, 07:08
Спасибо огромное. Хочется еще услышать предложения по посту http://forum.vingrad.ru/index.php?showtopic=223358&view=findpost&p=1625377

Автор: Platon 19.9.2008, 13:15
0.4.6
  - Исправлена ошибка регистра сайта
  + Добавлена подсветка Top10
  + И самый изюм экспорт в Excel файл

Автор: Platon 19.9.2008, 17:03
Приношу всем свои извинения, сборка программы получилась неправильной
- Успел исправить ошибку с загрузкой иконки.
0.4.6.1

Автор: Platon 22.9.2008, 09:49
0.4.7
+ Исправлена проблема с некоторыми favicon
+ Добавлен поисковик Google.lv
+ Добавлена поддержка латышского языка

Автор: Platon 23.9.2008, 13:48
0.4.8
+ Долгожданная поддержка подключения через Proxy

Автор: Platon 1.10.2008, 07:25
Обновил до версии 0.5.1
+ Проверка релевантных страниц 
- Исправлен алгоритм защиты IP от бана 
- Экспорт в Excel с окна анализа позиций

Автор: Platon 6.11.2008, 19:59
Давно не закидывал информаци. 
Тем временем версия 0.5.12.
Много чего добавлено/исправлено, лога не веду.
В блоге на блогспоте выложил темку. http://platon007.blogspot.com/2008/08/blog-post.html

Автор: Str!pe 24.11.2008, 16:50
Platon, Вы бы расширили список поисковиков smile)) а то не единым Рашен гуглем живы smile))

Автор: Platon 25.11.2008, 10:09
Str!pe, уже думал, 27-го важный день, до него ничего не делаю, после, думаю, добавлю внушительный список раш/нераш поисковиков ^_^

Автор: Platon 3.12.2008, 09:41
Так и ручки не дошли до доп поисковиков, но версия 0.5.15 уже бродит в интернете smile
С 12 версии изменилось:
- Rambler поменял формат вывода. Приведено в соответствие
+ сортировка по алфавиту ключевых фраз и по позициям в поисковиках 
+ поддержка прокси с http-авторизацией
+++ У программы появилась иконка, чему я несказанно рад. Осталось только титульник придумать. 
+ Появилась новая версия конфирурируемого парсера результатов запросов ПС 
+ копировать данные можно из всех списков, копировать данные из таблиц и вставлять, скажем в Excel, все данные будут раскинуты по нужным ячейкам. 
- найдено отсутствие менеджера паузы между запросами в конфигурируемом парсере. Устранено.

Автор: Str!pe 10.12.2008, 22:42
Если парсинг сделать не так как в семониторе (сначала весь список через один поисковик, потом весь список через другой поисковик и т.д.), а сделать допустим три слова через 1 поисковик, потом три слова через другой поисковик (возможность настроек) то это поможет не так сильно палиться перед поисковиками, а следовательно поможет избежать капчи дольше.

Добавлено @ 22:44
ЗЫ: Сейчас я парсю список из тысячи слов через семонитор без проксей на предмет позиций. За раз пускаю 10 слов по 4 поисковикам, за весь день так и не поймал ни одной капчи.

Автор: Platon 31.12.2008, 17:50
В канун НГ отмечусь и на этой тусовке.


Str!pe, 
Цитата(Str!pe @  10.12.2008,  23:42 Найти цитируемый пост)
Если парсинг сделать не так как в семониторе (сначала весь список через один поисковик, потом весь список через другой поисковик и т.д.)

Так было и сделано изначально. Странно, что вы этого не заметили.

Появилась новая версия 0.5.21, что нового с 0.5.15

0.5.16
- оптимизирована обработка данных в таблице истории анализа (уменьшилась задержка отклика на клики по списку сеансов и списку сайтов в окне Истории анализа)
- оптимизирована предварительная обработка данных процесса анализа позиций. (Быстрее появляется окно анализа)
* Крайне рекомендуется сменить пользователям, проверяющим более 100 ключевых фраз на проект.

0.5.17
+ добавлены контекстные меню в главное окно (Копировать, выделить всё, свойства).
- в очередной раз улучшил скорость отклика в окне истории и при старте анализа позиций.
+ при неудачной попытке подключиться к ПС ячейка ПС/Ключевик загорается красным.
- устранена ошибка при проблеме подключения к ПС. Программа запрашивала все страницы по ключевой фразе. Хотя понятно, что если ПС не отвечает на первой странице - она не ответит на следующей.

0.5.18
- исправлена ошибка настройки прокси
+ изменены размеры окна истории анализа (таблице отведено больше места)
+ показ страницы из поисковой выдачи 
+ диалоговое окно сводной статистики стало красивее и интернациональнее
+ копирование таблицы в буффер обмена с заголовком.

0.5.19
+ из таблиц копируется то, что показывается, а не только позиции.

0.5.20
    - программа стала кешировать рекламные картинки для уменьшения сетевого трафика.
+ добавил картинок к пунктам меню
+ определение PR и тИЦ сайтов в проекте

0.5.21
+++ импорт проектов из semonitor

Автор: Str!pe 31.12.2008, 19:44
Platon, там НЕ стоит.

Автор: Platon 2.1.2009, 09:59
В данный момент программа, вроде бы, и не палится.

Т.е. вы хотите сказать, что в моей программе если рассматривать для одного поисковика, , сейчас такая картина:
Берется одна фраза и с паузой в 4 секунды парсит страницы выдачи.
А вы хотите сказать, что можно параллельно пускать несколько фраз с такими же паузами?

И если брать по 3 слова в раз, то проверить позиции получится в 3 раза быстрее? Вы уверены, что так будет без палева?

Автор: Str!pe 21.1.2009, 11:22
Platon, я хотел сказать что программа палится. Что можно проверть допустим из списка сначала 5 слов в одном поисковике, затем те же пяь слов в другом, потом их же  втретьем а потом так же браться за остальные. За пять слов с паузой ничего не будет, а промежуток значительный получается.

Автор: Platon 26.1.2009, 17:44
А у меня вот такая задумка крутится. Возможность сделать запросы с зазновременными задержками, которые пользователь может прописать сам. Пример:
1,2,3,60
Будет значить, что первая пауза 1 сек, вторая - 2, третья 3, четвертая, чтоб не запалиться, 60, пятая опять 1 и т.д.

Автор: Str!pe 26.1.2009, 18:45
Platon, задумка отличная, для простоты сделать тупой рандомайзер который сам поставит задержку из заданого промежутка времени указаного пользователем... еще бы сделать так, что бы пользователь мог выбрать сколько за один заход проверять слов в каждом поисковике... тоесть проверяем из ста слов сначла перве 10 в каждом поисковике, потом слеждующие и тд и тп.

Автор: Platon 26.1.2009, 19:26
Str!pe, у меня и так рандомайзер стоит +/-30% от назначенной задержки.
А так мне интересно имеет ли смысл сделать такой массив пауз или обойтись рандомайзером?

Добавлено через 3 минуты и 31 секунду
Цитата(Str!pe @  26.1.2009,  19:45 Найти цитируемый пост)
тоесть проверяем из ста слов сначла перве 10 в каждом поисковике, потом слеждующие и тд и тп. 

Признаюсь, заморачиваться этим я в ближайшем времени не буду.

Автор: Str!pe 26.1.2009, 22:46
Цитата(Platon @  26.1.2009,  20:26 Найти цитируемый пост)
Признаюсь, заморачиваться этим я в ближайшем времени не буду.

Я ни куда не спешу, учитывая что мне нужен скрипт проверяющий позиции в промышленных маштабах.

Автор: dobradushny 10.11.2009, 21:11
Что то выдаёт совсем не то место...

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)