Модераторы: Partizan, gambit
  

Поиск:

Ответ в темуСоздание новой темы Создание опроса
> Обработка большого массива 
:(
    Опции темы
ДобренькийПапаша
Дата 23.12.2011, 08:58 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
***


Профиль
Группа: Завсегдатай
Сообщений: 1278
Регистрация: 14.1.2006
Где: г.Москва

Репутация: нет
Всего: 7



Есть массив экземпляров некоторого класса, который описывает проезд от одной станции до другой. Тарифный план, цена, станция отправления, назначения.
Многие из строк массива отличаются только перестановкой мест станций, ибо, чаще всего, можно доехать туда и обратно. Мне нужно удалить те строки, которые, по сути, являются дублирующими. Однако, есть и дополнительные ограничения, например, проезд из А в Б может стоит 20 рублей, а проезд из Б в А 35 рублей.

Массив содержит 2 миллиона строк. Сейчас обработка идёт пратически в лоб и занимает ОЧЕНЬ много времени. Вот реализация:
Код

private void RemoveDuplicates(List<PasswayInfo> passwayInfoList)
        {
            for (int i = passwayInfoList.Count - 1; i >= 0; i--)
            {                
                for (int j = i - 1; j >= 0; j--)
                {
                    if (passwayInfoList[i].DispatchStationCode == passwayInfoList[j].ReceivingStationCode
                        && passwayInfoList[i].ReceivingStationCode == passwayInfoList[j].DispatchStationCode
                        && passwayInfoList[i].TariffPlan == passwayInfoList[j].TariffPlan)
                    {
                        
                         passwayInfoList[i].IsIdenticalTariffPlan = true;  //Есть нужда в доп.пометках.
                         passwayInfoList[j].IsIdenticalTariffPlan = true;
                        

                        if (passwayInfoList[i].TicketCost == passwayInfoList[j].TicketCost)
                        {
                            passwayInfoList[i].IsIdenticalTicketCost = true; /Есть нужда в доп.пометках.
                            passwayInfoList[j].IsIdenticalTicketCost = true;
                        }

                        if (passwayInfoList[i].IsIdenticalTariffPlan && passwayInfoList[i].IsIdenticalTicketCost)
                        {
                            passwayInfoList[i].IsIdentical = true; /Есть нужда в доп.пометках.

                            passwayInfoList.RemoveAt(j);
                            i--;
                        }
                    }
                }
            }
        }


Как можно улучшить алгоритм и ускорить нахождение и удаление "дубликатов"?


--------------------
Меня зовут Себастьян Парейра, торговец чёрным деревом.
PM MAIL   Вверх
Экскалупатор
Дата 23.12.2011, 10:22 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
***


Профиль
Группа: Завсегдатай
Сообщений: 1746
Регистрация: 1.4.2009
Где: г. Минск

Репутация: 11
Всего: 24



может имеет смысл их туда не добавлять если уже есть такие? использовать к примеру словарь, с каким то уникальным ключем, или дерево к примеру.
PM MAIL ICQ   Вверх
ДобренькийПапаша
Дата 23.12.2011, 10:36 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
***


Профиль
Группа: Завсегдатай
Сообщений: 1278
Регистрация: 14.1.2006
Где: г.Москва

Репутация: нет
Всего: 7



Цитата(Экскалупатор @ 23.12.2011,  10:22)
может имеет смысл их туда не добавлять если уже есть такие? использовать к примеру словарь, с каким то уникальным ключем, или дерево к примеру.

Я разбираю xml в массив, чтобы затем засунуть в таблицы в базе данных. Тут от одной станции доехать можно до целой кучи, с ключом не получиться.


--------------------
Меня зовут Себастьян Парейра, торговец чёрным деревом.
PM MAIL   Вверх
Экскалупатор
Дата 23.12.2011, 14:00 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
***


Профиль
Группа: Завсегдатай
Сообщений: 1746
Регистрация: 1.4.2009
Где: г. Минск

Репутация: 11
Всего: 24



тогда я не совсем понимаю что значит "дубликаты". по сути если рассматривать станцию то это объект, они должны быть уникальными, потом уже нужно определить связи между этими объектами(ну и цену такой связи). при таком раскладе можно использовать ключ(хоть по всем полям объекта станция) и не добавлять в коллекцию элемент с уже существующим ключем.
в любом случае я думаю что проще не добавить объект чем потом искать повторяющиеся. просто проверку нужно делать в процессе добавления, а не потом.
PM MAIL ICQ   Вверх
ДобренькийПапаша
Дата 23.12.2011, 17:48 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Эксперт
***


Профиль
Группа: Завсегдатай
Сообщений: 1278
Регистрация: 14.1.2006
Где: г.Москва

Репутация: нет
Всего: 7



Точно. Т.е. Использовать словарь, где ключ - код станции, а значение - список станций до которых от неё можно доехать. Попробую. Ну, и, плюс, да, ты прав, нужно не добавлять ненужные строки ещё на этапе разбора xml.


--------------------
Меня зовут Себастьян Парейра, торговец чёрным деревом.
PM MAIL   Вверх
  
Ответ в темуСоздание новой темы Создание опроса
Прежде чем создать тему, посмотрите сюда:
mr.DUDA
THandle

Используйте теги [code=csharp][/code] для подсветки кода. Используйтe чекбокс "транслит" если у Вас нет русских шрифтов.
Что делать если Вам помогли, но отблагодарить помощника плюсом в репутацию Вы не можете(не хватает сообщений)? Пишите сюда, или отправляйте репорт. Поставим :)
Так же не забывайте отмечать свой вопрос решенным, если он таковым является :)


Если Вам понравилась атмосфера форума, заходите к нам чаще! С уважением, mr.DUDA, THandle.

 
0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей)
0 Пользователей:
« Предыдущая тема | Общие вопросы по .NET и C# | Следующая тема »


 




[ Время генерации скрипта: 0.0416 ]   [ Использовано запросов: 22 ]   [ GZIP включён ]


Реклама на сайте     Информационное спонсорство

 
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности     Powered by Invision Power Board(R) 1.3 © 2003  IPS, Inc.