Модераторы: Illuminaty
  

Поиск:

Ответ в темуСоздание новой темы Создание опроса
> какая кодировка у тегов? 
:(
    Опции темы
victor79
Дата 27.4.2014, 16:58 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


программист
*


Профиль
Группа: Участник
Сообщений: 211
Регистрация: 15.5.2008

Репутация: нет
Всего: нет



про теги Content-Type: charset и meta charsert это понятно. Интересует следующая схема. Content-Type не задан. Значит нужно взять из meta charset, но какой кодировкой парсить HTML еще до распарсивания этого тега? В ISO 8859-1? Т.е. до тега кодировки делать дефаултную, а после стопорнуть iconv и указать ему другую таблицу?

Я делаю парсер, что-то вроде yacc, которым будет парситься разная фигня, преимущественно не HTML, но меня интересует универсальность. Весь входящий текст проходит через перекодировщик, что бы соответствовать кодировке программы. Так же интересно, как задавать кодировку самой моей программы в теле самой программы.
PM MAIL WWW   Вверх
ksnk
Дата 27.4.2014, 17:29 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


прохожий
****


Профиль
Группа: Комодератор
Сообщений: 6855
Регистрация: 13.4.2007
Где: СПб

Репутация: 48
Всего: 386



victor79, есть такая фенечка, как c mb_detect_encoding. Не подойдет?


--------------------
Человеку свойственно ошибаться, программисту свойственно ошибаться профессионально ! user posted image
PM MAIL WWW Skype   Вверх
victor79
Дата 27.4.2014, 17:39 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


программист
*


Профиль
Группа: Участник
Сообщений: 211
Регистрация: 15.5.2008

Репутация: нет
Всего: нет



даже если бы у меня был PHP (а у меня на Си++), то все равно не то. Меня скорее интересует, что по этому поводу говорит какой нибудь стандарт, т.к. в реальности все равно заголовок до тега кодировки можно парсить как ASCII, т.к. там только английские символы.

В интернете найти такую штуку сложно, т.к. на запрос "html кодировка" выдается на много страниц про теги кодировки, а про этот нюанс ни слова.
PM MAIL WWW   Вверх
AVA12
Дата 27.4.2014, 19:26 (ссылка) | (нет голосов) Загрузка ... Загрузка ... Быстрая цитата Цитата


Шустрый
*


Профиль
Группа: Участник
Сообщений: 135
Регистрация: 4.5.2008

Репутация: 1
Всего: 4



А какие варианты могуть быть в принципе?
1. Однобайтные кодировки, UTF-8, японские кодировки: символы ASCII 00 - 7E кодируются одним байтом, так что можно смело парсить файл, как ISO 8859-1.
2. UTF-16 (и, возможно, UCS-2): каждый символ кодируется двумя байтами, причем порядок байт может быть разным. В начале такого файла, скорее всего, будет соответствующий BOM. Даже если его нет - не страшно, в HTML первым символом наверняка будет ASCII (пробел или начало тега), в представлении которого обязательно будет NUL. Значит, смотрим первые два байта файла, если видим BOM или NUL - парсим, как UCS-2.
3. Существование экзотики вроде EBCDIC, UTF-7, UTF-32 и прочее, думаю, можно смело игнорировать.
PM ICQ Jabber   Вверх
  
Ответ в темуСоздание новой темы Создание опроса
0 Пользователей читают эту тему (0 Гостей и 0 Скрытых Пользователей)
0 Пользователей:
« Предыдущая тема | Вёрстка веб-сайтов | Следующая тема »


 




[ Время генерации скрипта: 0.3722 ]   [ Использовано запросов: 21 ]   [ GZIP включён ]


Реклама на сайте     Информационное спонсорство

 
По вопросам размещения рекламы пишите на vladimir(sobaka)vingrad.ru
Отказ от ответственности     Powered by Invision Power Board(R) 1.3 © 2003  IPS, Inc.