Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Visual C++/MFC/WTL > получение исходного HTML текста из WebBrowser


Автор: Qubbo 13.3.2007, 14:33
В VC2005 воспольсовался уомпонентом webbrowser,
Указал ссылку на сайт, сайт загрузился после этого мне необходимо получить html код это страницы, но дело в том что когда я пытаюсь его получить методом this-WebBrowser1->DocumentText у меня пропадают все русские буквы, как решить эту проблему ?

Мне потом пробежатся надо по этому ХТМЛ тексту в поисках данных в определенных тегах...
чтото вроде Получить все что находит между "<td><br><a href=?>" и "</a><td>"...
я кстати не понял как это сделать пришлось subster'ером пробежатся по HTML а он чето так тормозно работает ...

Автор: _hunter 13.3.2007, 15:04
куда пропадают? что на из месте находится? да и код привести не помешало бы...

Автор: Qubbo 14.3.2007, 07:47
Цитата(_hunter @ 13.3.2007,  15:04)
куда пропадают? что на из месте находится? да и код привести не помешало бы...

this->textBox1->Text = this->webBrowser1->DocumentText;
Url (изначально) c:/test.html

содержимое c:/test.html  (в win кодировке)

Проверка !

в результате в textBox1 появляется только Пробел и Восклик и все, русские символы как будто вырезаются ! и это не только с локальным файлом, проверял и в инете например http://www.ru/rus/index.html указывал, тоже самое все выводится а русских буковок нету (как будто вырезали)

Автор: _hunter 14.3.2007, 12:12
а в test.html что? и как ты так умудрился текст получить? нужно сначала взять Document, у него брать body а уже у него брать innerHTML/innerText

Автор: Qubbo 15.3.2007, 08:27
Цитата(_hunter @ 14.3.2007,  12:12)
а в test.html что? и как ты так умудрился текст получить? нужно сначала взять Document, у него брать body а уже у него брать innerHTML/innerText

в test.html только вот эта строка -> "Проверка !"

Насчет как умудрился, я поставил это действие (this->textBox1->Text = this->webBrowser1->DocumentText;) на кнопку, дождался когда загрузится страница и нажал (выполнил это действие) и в textBox1 получил HTML страницы, только Буковы Русские там отсутствовали напрочь.

насчет брать body я попробовал работает и с русскими буквами, но как я понял Боди возьмет все что между тегами Боди находится ? а мне нужно все содержимое....


Автор: _hunter 15.3.2007, 11:46
Цитата(Qubbo @  15.3.2007,  08:27 Найти цитируемый пост)
в test.html только вот эта строка -> "Проверка !"

тогда какой это HTML?

Цитата(Qubbo @  15.3.2007,  08:27 Найти цитируемый пост)
но как я понял Боди возьмет все что между тегами Боди находится ? а мне нужно все содержимое....

Цитата(Qubbo @  13.3.2007,  14:33 Найти цитируемый пост)
Мне потом пробежатся надо по этому ХТМЛ тексту в поисках данных в определенных тегах...
чтото вроде Получить все что находит между "<td><br><a href=?>" и "</a><td>"...

ты определись что тебе нужно...
можеш еще toString документа попробовать...

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)