Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Java: Общие вопросы > RTFEditorKit: проблема с Unicode


Автор: Swiftcode 28.7.2014, 11:20
Приветствую, коллеги!  smile 

Случилось мне столкнуться с конвертацией HTML в RTF содержимое (хранится в БД Oracle как CLOB), всё бы ничего, решил задачу, но обнаружил, что при конвертации HTMLEditorKit => RTFEditorKit Unicode символы (буквы казахского языка) игнорируются RTFEditorKit'ом, в базу ложаться как ? (вопросы). В логах они тоже как вопросы.

Код

public static String convertHTMLtoRtf(String html) {
      ByteArrayInputStream input= new ByteArrayInputStream(html.getBytes());
      ByteArrayOutputStream baos = new ByteArrayOutputStream();
            try {
                    RTFEditorKit rtfEditorKit = new RTFEditorKit();
                    HTMLEditorKit htmlEditorKit = new HTMLEditorKit();
                    Document htmlDoc = htmlEditorKit.createDefaultDocument();
                    htmlEditorKit.read(input, htmlDoc, 0);
                    rtfEditorKit.write(baos, htmlDoc, 0, htmlDoc.getLength());
            } catch (Exception ex) {
                    LOGGER.error("html 2 rtf! ", ex);
            }
       return baos.toString();
}


Как проверялось? 
На Windows стоит Oracle 11g база данных, с ней работает Desktop клиент на Delphi, который сохраняет текст в базу как RTF, моя задача повторить это на JAVA. Соответственно сохраненный RTFEditorKit'ом текст Desktop клиент на дельфи тоже "видит" как вопросы. Хотя сам с юникодом отлично ладит. 
Вывод: Значит проблема не в базе и не в системе.  smile 

В итоге выяснил, что RTFEditorKit конвертирует текст в такой формат:  
Код

{\rtf1\ansi
{\fonttbl\f0\fnil Monospaced;}
\par
111\par\u1040 ??\u1041 ?\u1042 ?\u1043 ??\u1044 ?\u1045 ?\u1025 ?\u1046 ?\u1047 ?\u1048 
?\u1049 ?\u1050 ??\u1051 ?\u1052 ?\u1053 ??\u1054 ??\u1055 ?\u1056 ?\u1057 ?\u1058 ?\u1059 
???\u1060 ?\u1061 ??\u1062 ?\u1063 ?\u1064 ?\u1065 ?\u1066 ?\u1067 ?\u1030 ?\u1068 ?\u1069 
?\u1070 ?\u1071 ?\par111\par\u1072 ??\u1073 ?\u1074 ?\u1075 ??\u1076 ?\u1077 ?\u1105 ?\u1078 
?\u1079 ?\u1080 ?\u1081 ?\u1082 ??\u1083 ?\u1084 ?\u1085 ??\u1086 ??\u1087 ?\u1088 ?\u1089 
?\u1090 ?\u1091 ???\u1092 ?\u1093 ??\u1094 ?\u1095 ?\u1096 ?\u1097 ?\u1098 ?\u1099 ?\u1110 
?\u1100 ?\u1101 ?\u1102 ?\u1103 ?\par
}


А дельфи клиент тот же текст сохраняет вот так:
Код

{\rtf1\ansi\ansicpg1251\deff0{\fonttbl{\f0\fnil\fcharset0 Tahoma;}{\f1\fnil\fcharset204 Tahoma;}}
\viewkind4\uc1\pard\lang1033\f0\fs16 111\par
\lang1049\f1\'c0\u1240?\'c1\'c2\'c3\u1170?\'c4\'c5\'a8\'c6\'c7\'c8\'c9\'ca\u1178?\'cb\'cc\'cd
\u1186?\'ce\u1256?\'cf\'d0\'d1\'d2\'d3\u1200?\u1198?\'d4\'d5\u1210?\'d6\'d7\'d8\'d9\'da
\'db\'b2\'dc\'dd\'de\'df\par
\lang1033\f0 111\lang1049\f1\par
\'e0\u1241?\'e1\'e2\'e3\u1171?\'e4\'e5\'b8\'e6\'e7\'e8\'e9\'ea\u1179?\'eb\'ec\'ed\u1187?
\'ee\u1257?\'ef\'f0\'f1\'f2\'f3\u1201?\u1199?\'f4\'f5\u1211?\'f6\'f7\'f8\'f9\'fa\'fb\'b3\'fc\'fd\'fe\'ff\par
}


UPD: Выяснил, что кодировка ломается на этапе htmlEditorKit.read(input, htmlDoc, 0);
То есть, виноват htmlEditorKit. html - кодировка цела, а htmlDoc - содержит уже вопросы вместо казахских символов.
Пробовал getBytes, в html исходник подсунуть meta charset=UTF-8, но итог нулевой.

1) Не понимаю где нужно указать нужную кодировку, и возможно ли? 
2) Можно ли заставить RTFEditorKit конвертировать символы в формат \'e1\'e2\'e3... как во втором примере

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)