Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > PHP: Общие вопросы > Странности с Чешским и UTF-8


Автор: supercelt 7.12.2009, 13:35
Здравствуйте. Такая проблема. 
Есть скрипт, который парсит чешский поисковик. Но сделано так, что результаты поиска на лету заменяются из тэга мета с сайта который нашёл поисковик. 
Парсер полностью на утф8, база тоже. 
Проблема возникает когда беру мету с сайтов 
Код

$meta = get_meta_tags($jumpto);
$meta_desc = $meta['description'];

Вот таким образом. Фишка в том, что некоторые сайты в кодировке win - 1250 и $meta_desc получаются каракули. В некоторых кодировка - мак, и я сначала преобразую из мак в вин, а из вин в утф, но тогда чешские буквы заменяются просто русскими. Но самая большая беда в том, что некоторые сайты на утф 8, и даже в исходном коде, в теге мета встречаются чёрные ромбики со знаком вопроса внутри. А язык у сайта прописан - cz. 
Потом я вставляю эти результаты в базу и как только доходит до такого ромбика, - всё, в базу после этого ничего не вставляется.

Автор: Pitlord 7.12.2009, 17:53
Язык страницы значения не имеет, важна только кодировка.

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)