Модераторы: Daevaorn

Поиск:

Ответ в темуСоздание новой темы Создание опроса
> Ассоциативный контейнер, для составление рейтинга 
:(
    Опции темы
MastEdm
  Дата 22.7.2008, 09:39 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



Добрый день.

Задача такая. Построить рейтинг строк, подсчитать, сколько раз встречается каждая строка. Если использовать std::map<std::string, int>, то можно нормально увеличивать счетчик, но тогда сортировка производится по строкам, хотя нужно по значению счетчика. Если использовать std::set<std::pair<std::string, int> >, то можно задать свою функцию сортировки, но тогда для увеличения счетчика придется сначала каким-то образом находить нужную запись. К слову сказать, добавление строк производится гораздо чаще, чем построение самого отчета. Как я понял, для map нельзя написать функцию сравнения для значения (только для ключа). Может можно еще придумать какую-нибудь структуру данных? 

Да, еще нужно уметь по строке определить ее позицию в рейтинге. Это уже, конечно, дополнительный функционал, но все-таки.
PM MAIL   Вверх
vinter
Дата 22.7.2008, 10:04 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Explorer
****


Профиль
Группа: Завсегдатай
Сообщений: 2735
Регистрация: 1.4.2006
Где: Н.Новгород

Репутация: 13
Всего: 56



Цитата(MastEdm @  22.7.2008,  10:39 Найти цитируемый пост)
но тогда для увеличения счетчика придется сначала каким-то образом находить нужную запись

делаешь функтор\функцию сравнения для second из pair, потом lower_bound\find для поиска. Только изменяй по следующей схеме, удаляешь элемеент и записываешь уже новый, измененный. Если бы не частое добавление, то можно было бы юзать сортированный вектор



--------------------
Мой блог
PM MAIL WWW   Вверх
MastEdm
Дата 22.7.2008, 11:05 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



А как в таком случае искать нужную пару? С помощью пары ("строка", 1)? Но ведь если у нас сортировка задана по счетчику, то это будет неэффективно, тем более для строк с большим значением счетчика.
PM MAIL   Вверх
vinter
Дата 22.7.2008, 11:23 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Explorer
****


Профиль
Группа: Завсегдатай
Сообщений: 2735
Регистрация: 1.4.2006
Где: Н.Новгород

Репутация: 13
Всего: 56



Цитата(MastEdm @  22.7.2008,  12:05 Найти цитируемый пост)
Но ведь если у нас сортировка задана по счетчику, то это будет неэффективно, тем более для строк с большим значением счетчика. 

O(ln(n))
Цитата(MastEdm @  22.7.2008,  12:05 Найти цитируемый пост)
А как в таком случае искать нужную пару? С помощью пары ("строка", 1)?

так искать надо по паре? или только по счетчику?


--------------------
Мой блог
PM MAIL WWW   Вверх
MastEdm
Дата 22.7.2008, 11:29 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



Ну вот когда добавляем очередную строку: если она есть (вот тут нужно найти пару ("строка", [число])), то её счетчик увеличивается на 1, в противном случае добавляем пару ("строка", 1). 
PM MAIL   Вверх
xvr
Дата 22.7.2008, 11:40 (ссылка) |    (голосов:1) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
****


Профиль
Группа: Комодератор
Сообщений: 7046
Регистрация: 28.8.2007
Где: Дублин, Ирландия

Репутация: 60
Всего: 223



Цитата(MastEdm @ 22.7.2008,  09:39)
Добрый день.

Задача такая. Построить рейтинг строк, подсчитать, сколько раз встречается каждая строка.

boost::multi_index_container
PM MAIL   Вверх
vinter
Дата 22.7.2008, 12:24 (ссылка) |    (голосов:1) Загрузка ... Загрузка ... Быстрая цитата Цитата


Explorer
****


Профиль
Группа: Завсегдатай
Сообщений: 2735
Регистрация: 1.4.2006
Где: Н.Новгород

Репутация: 13
Всего: 56



Цитата(MastEdm @  22.7.2008,  12:29 Найти цитируемый пост)
Ну вот когда добавляем очередную строку: если она есть (вот тут нужно найти пару ("строка", [число])), то её счетчик увеличивается на 1, в противном случае добавляем пару ("строка", 1).  

ну так в чем прроблема? пишешь две функции сравнения, одна по счетчика(ее передаем в контейнер при создании), вторая по строке(ее передаем в ф-ию поиска) ф-ия поиска возвращает итератор, по которому мы удаляем 'элемент и записываем новый с обновленным счетчиком


--------------------
Мой блог
PM MAIL WWW   Вверх
MastEdm
Дата 22.7.2008, 13:07 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



Ясно. Спасибо smile  

А что эффективнее: map с map["строка"] += 1 или set с find_if()? То есть использует ли find_if() информацию о последовательности или же тупо циклом просматривает все элементы?

Это сообщение отредактировал(а) MastEdm - 22.7.2008, 13:26
PM MAIL   Вверх
MastEdm
Дата 22.7.2008, 15:07 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



Цитата(xvr @ 22.7.2008,  11:40)
Цитата(MastEdm @ 22.7.2008,  09:39)
Добрый день.

Задача такая. Построить рейтинг строк, подсчитать, сколько раз встречается каждая строка.

boost::multi_index_container

А вы не могли бы набросать примерчик, а то я в boost не силен и первое знакомство (тут) как-то не пошло

Это сообщение отредактировал(а) MastEdm - 22.7.2008, 15:38
PM MAIL   Вверх
vinter
Дата 22.7.2008, 16:08 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Explorer
****


Профиль
Группа: Завсегдатай
Сообщений: 2735
Регистрация: 1.4.2006
Где: Н.Новгород

Репутация: 13
Всего: 56



Цитата(MastEdm @  22.7.2008,  14:07 Найти цитируемый пост)
А что эффективнее: map с map["строка"] += 1 или set с find_if()? То есть использует ли find_if() информацию о последовательности или же тупо циклом просматривает все элементы?

если find_if это алгоритм контейнера, то эффективность равнозначна.


--------------------
Мой блог
PM MAIL WWW   Вверх
Rififi
Дата 22.7.2008, 19:14 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
***


Профиль
Группа: Завсегдатай
Сообщений: 1254
Регистрация: 9.3.2008

Репутация: 11
Всего: 36



MastEdm, 
тебе нужен контейнер с возможностью независимого поиска как по ключу, так и по значению.
либо сооруди такой сам из двух std::map, либо поищи в сети готовые варианты. В boost тоже есть, и не в одном варианте.
PM MAIL   Вверх
Ulysses4j
Дата 22.7.2008, 19:41 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Опытный
**


Профиль
Группа: Участник
Сообщений: 304
Регистрация: 6.6.2007
Где: Ростов-на-Дону

Репутация: 4
Всего: 10



Цитата(xvr @  22.7.2008,  12:40 Найти цитируемый пост)
boost::multi_index_container

Кажется, скореее boost::bimap — более специализировано для данной задачи.


--------------------
Communication is critical to the job of a programmer.
C. Jazdzewski. Fatherly Advice To New Programmers
PM MAIL WWW   Вверх
MastEdm
Дата 23.7.2008, 09:38 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



Интересно, а за какое время производится добавление и поиск в boost::multi_index_container? Ведь где-то мы должны проиграть  smile

Это сообщение отредактировал(а) MastEdm - 23.7.2008, 09:39
PM MAIL   Вверх
xvr
Дата 23.7.2008, 10:53 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
****


Профиль
Группа: Комодератор
Сообщений: 7046
Регистрация: 28.8.2007
Где: Дублин, Ирландия

Репутация: 60
Всего: 223



Цитата(MastEdm @ 22.7.2008,  15:07)
Цитата(xvr @ 22.7.2008,  11:40)
Цитата(MastEdm @ 22.7.2008,  09:39)
Добрый день.

Задача такая. Построить рейтинг строк, подсчитать, сколько раз встречается каждая строка.

boost::multi_index_container

А вы не могли бы набросать примерчик, а то я в boost не силен и первое знакомство (тут) как-то не пошло

boost::bimap (действительно более подходящий) - http://www.boost.org/doc/libs/1_35_0/libs/...html/index.html
boost::multi_index_container - http://www.boost.org/doc/libs/1_35_0/libs/.../doc/index.html

PM MAIL   Вверх
MastEdm
Дата 5.8.2008, 22:03 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



И все-таки если вернуться к эффективности. Добавление в map происходит за логарифмическое время. То есть при добавлении строки в рейтинг мы можем найти ее за log(n) и прибавить к ее счетчику 1, а если ее нет, то добавить как новую пару <строка, 1> за тоже время. Когда же нам нужно построить сам рейтинг, то есть отсортировать строки по счетчику, то придется перебрать все элементы и добавить, к примеру, в multimap с сортировкой по счетчику. Получаем время n*log(n).  Теперь если нам нужно определить положение конкретной строки в рейтинге, то осуществляем полный перебор сформированного ранее multimap. Подитожу выше сказанное по операциям:

add(string)         C*log(n)
get_rating()        C*n*log(n)
get_pos(string)  C*n*log(n)

Результаты неутешительные (если, конечно, я нигде не наврал).

Не уверен, что предложенные контейнеры из boost работают быстрее. Если я неправ, переубедите меня smile 


PM MAIL   Вверх
MastEdm
Дата 6.8.2008, 17:20 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



После некоторых размышлений родился такой вариант (строки заменил на идентификаторы):

Код

class top
{
    private:
        static const unsigned size = 1000;

        struct node
        {
            unsigned id;
            unsigned count;
            unsigned pos;
        };

        typedef std::map<unsigned, node*> top_t;

        top_t top_map;
        node* table[size];

        int end_pos;

    public:

        top()
        {
            end_pos = 0;
        }

        ~top() { ; }

        void add ( unsigned id )
        {
            top_t::iterator iter = top_map.find ( id );
            if ( iter != top_map.end() )
            {
                node* nd = ( *iter ).second;
                nd->count += 1;
                unsigned pos = nd->pos;
                // Пересчитываем топ, поднимая в нем нужную запись
                }
            }
            else
            {
                if ( end_pos < size )
                {
                    node* nd = new node();
                    nd->id = id;
                    nd->count = 1;
                    nd->pos = end_pos;
                    table[nd->pos] = nd;
                    end_pos += 1;
                    top_map[id] = nd;
                }
            }
        }

        unsigned get_pos_by_id ( unsigned id )
        {
            top_t::iterator iter = top_map.find ( id );
            if ( iter != top_map.end() )
            {
                return ( *iter ).second->pos;
            }
            else
            {
                return static_cast<unsigned> ( -1 );
            }
        }

        void print_table()
        {
            for ( int i = 0; i < end_pos; ++i )
            {
                std::cout << table[i]->pos << " " << table[i]->id << " "
                << table[i]->count << std::endl;
            }
        }
};


При таком раскладе добавление за log(n), построение таблицы константное время занимает (я не учитываю печать), определение позиции по id за log(n). Может что-то можно эффективнее сделать?

PS Прошу не пинать за форматирование кода: пришлось применить автоматическое форматирование из kdevelop, поскольку сам пишу в emacs...

Это сообщение отредактировал(а) MastEdm - 8.8.2008, 14:59
PM MAIL   Вверх
maxim1000
Дата 6.8.2008, 22:21 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
****


Профиль
Группа: Участник
Сообщений: 3334
Регистрация: 11.1.2003
Где: Киев

Репутация: 17
Всего: 110



Цитата(MastEdm @  6.8.2008,  17:20 Найти цитируемый пост)
При таком раскладе добавление за log(n)

ох, не уверен
вот этот цикл:
Цитата(MastEdm @  6.8.2008,  17:20 Найти цитируемый пост)

                    while ( table[pos]->count > table[prev]->count )
                    {
                        if ( prev == 0 ) break;
                        prev -= 1;
                    }

,как мне кажется, может сделать из логирифма линейное время
предположим, что у нас получилось куча слов с одинаковым количеством экземляров (что, в общем-то, для обычного текста не так уж странно), тогда при увеличении одного из таких слов придётся его протащить наверх, срелняя длина будет пропорицональна длине такого отрезка

Добавлено через 3 минуты и 17 секунд
можно тупо построить мапу <строка, количество экземпляров>, потом перегнать её в вектор пар, отсортировать его по строкам и искать там нужную строку за логарифм (т.к. отсортированный), а индекс - как раз нужная позиция


--------------------
qqq
PM WWW   Вверх
MastEdm
Дата 6.8.2008, 22:28 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



Да, конечно. Но поскольку слово редкое, то и добавляться оно будет не так часто. Вернее сказать оно добавится только один раз и сразу запишется в конец. Хотя над этим местом стоит подумать. Есть идея ввести пороговое минимальное значение, ниже которого все значения считать равными. В моей задаче время критично. Поэтому хотелось бы получить наиболее оптимальное решение.
PM MAIL   Вверх
MastEdm
Дата 7.8.2008, 22:00 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Master
*


Профиль
Группа: Участник
Сообщений: 178
Регистрация: 3.12.2005
Где: Москва, МГИУ

Репутация: 1
Всего: 2



Цитата(maxim1000 @ 6.8.2008,  22:21)

можно тупо построить мапу <строка, количество экземпляров>, потом перегнать её в вектор пар, отсортировать его по строкам и искать там нужную строку за логарифм (т.к. отсортированный), а индекс - как раз нужная позиция

Можно, только сортировка в любом случае займет n*log(n). И сортировать нужно не по строкам, а по счетчику. Мы ведь рейтинг строим. А если отсортировано по счетчику, то по строке искать за логарифм не получится.

Итого, по двум вариантам алгоритма:
  • Добавление: log(n), Определение позиции: n*log(n)
  • Добавление: n*log(n), Определение позиции: log(n)
 

У меня складывается дурное предчувствие, что ничего лучше придумать не получится  smile 

Есть такая мысля. Заводим два массива указателей на структуру:
Код

struct node {
    int id;        // Id строки
    int count; // Счетчик
    int pos;    // Позиция в рейтинге
};

node* table[SIZE];
node* top[SIZE];

Индексация в массиве table по id строки, а в top записи отсортированы по счетчику. Таким образом добавление займет время C*n в худшем случае, определение позиции - константное время. 

Вроде все хорошо, но теперь встанет вопрос об индексации строк. Благо для этого у меня уже есть отлаженный механизм smile 




Это сообщение отредактировал(а) MastEdm - 8.8.2008, 14:04
PM MAIL   Вверх
maxim1000
Дата 8.8.2008, 15:22 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
****


Профиль
Группа: Участник
Сообщений: 3334
Регистрация: 11.1.2003
Где: Киев

Репутация: 17
Всего: 110



Цитата(MastEdm @  7.8.2008,  22:00 Найти цитируемый пост)
И сортировать нужно не по строкам, а по счетчику. Мы ведь рейтинг строим. А если отсортировано по счетчику, то по строке искать за логарифм не получится.

да, это я что-то ступил маленько...
можно сначала отсортировать по счётчику, пробежаться, подобавлять в каждую запись позицию (т.е. индекс), а потом - по строкам, чтобы искать легко было
но быстрее n*log n вряд ли что-то получится...


--------------------
qqq
PM WWW   Вверх
Страницы: (2) [Все] 1 2 
Ответ в темуСоздание новой темы Создание опроса
Правила форума "С++:Общие вопросы"
Earnest Daevaorn

Добро пожаловать!

  • Черновик стандарта C++ (за октябрь 2005) можно скачать с этого сайта. Прямая ссылка на файл черновика(4.4мб).
  • Черновик стандарта C (за сентябрь 2005) можно скачать с этого сайта. Прямая ссылка на файл черновика (3.4мб).
  • Прежде чем задать вопрос, прочтите это и/или это!
  • Здесь хранится весь мировой запас ссылок на документы, связанные с C++ :)
  • Не брезгуйте пользоваться тегами [code=cpp][/code].
  • Пожалуйста, не просите написать за вас программы в этом разделе - для этого существует "Центр Помощи".
  • C++ FAQ

Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, Earnest Daevaorn

 
0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей)
0 Пользователей:
« Предыдущая тема | C/C++: Общие вопросы | Следующая тема »


 




[ Время генерации скрипта: 0.0633 ]   [ Использовано запросов: 22 ]   [ GZIP включён ]


Реклама на сайте     Информационное спонсорство

 
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности     Powered by Invision Power Board(R) 1.3 © 2003  IPS, Inc.