Как проверить, является ли кодировка строки UTF8?
Как проверить кодировку строки?
Ответ 1
function is_utf8($string) {
return preg_match('%^(?:
[\x09\x0A\x0D\x20-\x7E] # ASCII
| [\xC2-\xDF][\x80-\xBF] # non-overlong 2-byte
| \xE0[\xA0-\xBF][\x80-\xBF] # excluding overlongs
| [\xE1-\xEC\xEE\xEF][\x80-\xBF]{2} # straight 3-byte
| \xED[\x80-\x9F][\x80-\xBF] # excluding surrogates
| \xF0[\x90-\xBF][\x80-\xBF]{2} # planes 1-3
| [\xF1-\xF3][\x80-\xBF]{3} # planes 4-15
| \xF4[\x80-\x8F][\x80-\xBF]{2} # plane 16
)*$%xs', $string);
}
Я проверил. Эта функция эффективна.
Ответ 2
Не изобретайте велосипед. Для этой задачи есть встроенная функция: mb_check_encoding()
.
mb_check_encoding($string, 'UTF-8');
Ответ 3
Только примечание:
Вы не можете определить, закодирована ли данная строка в UTF-8. Вы можете только определить, является ли данная строка окончательно не, закодированной в UTF-8. См. Соответствующий вопрос здесь:
Вы не можете определить, должна ли данная строка (или байтовая последовательность) является кодировкой UTF-8 текст, как, например, каждый серия октетов UTF-8 также действительна (если бессмысленно) серии латинского-1 (или некоторые другие кодировки) октетов. Однако не каждая серия действительных латинских-1 октеты действительны серии UTF-8.
Ответ 4
Еще лучше, используйте оба вышеупомянутых решения.
function isUtf8($string) {
if (function_exists("mb_check_encoding") && is_callable("mb_check_encoding")) {
return mb_check_encoding($string, 'UTF8');
}
return preg_match('%^(?:
[\x09\x0A\x0D\x20-\x7E] # ASCII
| [\xC2-\xDF][\x80-\xBF] # non-overlong 2-byte
| \xE0[\xA0-\xBF][\x80-\xBF] # excluding overlongs
| [\xE1-\xEC\xEE\xEF][\x80-\xBF]{2} # straight 3-byte
| \xED[\x80-\x9F][\x80-\xBF] # excluding surrogates
| \xF0[\x90-\xBF][\x80-\xBF]{2} # planes 1-3
| [\xF1-\xF3][\x80-\xBF]{3} # planes 4-15
| \xF4[\x80-\x8F][\x80-\xBF]{2} # plane 16
)*$%xs', $string);
}
Ответ 5
mb_detect_encoding($string);
вернет фактический набор символов $string
. mb_check_encoding($string, 'UTF-8');
вернет TRUE, если набор символов $string
равен UTF-8 else FALSE
Ответ 6
если его отправить на сервер с сервера
echo $_SERVER['HTTP_ACCEPT_CHARSET'];
Ответ 7
Ни один из приведенных выше ответов не является правильным. Да, они могут работать. Если вы ответите с помощью функции preg_replace
, пытаетесь ли вы убить ваш сервер, если вы обрабатываете много изменений? Используйте эту чистую PHP-функцию без регулярного выражения, работайте в 100% случаев и быстрее.
if(function_exists('grk_Is_UTF8') === FALSE){
function grk_Is_UTF8($String=''){
# On va calculer la longeur de la chaîne
$Len = strlen($String);
# On va boucler sur chaque caractère
for($i = 0; $i < $Len; $i++){
# On va aller chercher la valeur ASCII du caractère
$Ord = ord($String[$i]);
if($Ord > 128){
if($Ord > 247){
return FALSE;
} elseif($Ord > 239){
$Bytes = 4;
} elseif($Ord > 223){
$Bytes = 3;
} elseif($Ord > 191){
$Bytes = 2;
} else {
return FALSE;
}
#
if(($i + $Bytes) > $Len){
return FALSE;
}
# On va boucler sur chaque bytes / caractères
while($Bytes > 1){
# +1
$i++;
# On va aller chercher la valeur ASCII du caractère / byte
$Ord = ord($String[$i]);
if($Ord < 128 OR $Ord > 191){
return FALSE;
}
# Parfait
$Bytes--;
}
}
}
# Vrai
return TRUE;
}
}