字符串截取是一个非常常见的编程任务,而往往带中文的字符串截取会经常用到。虽然不难,但是自己写函数实现又耗费时间,这里介绍几个个比较好用的字符串截取函数,能够胜任基本的需求了。
PHP内置的substr无法解决截取中文字符串的乱码问题,在PHP.ini打开extension=PHP_mbstring.dll支持的情况下,可以使用mb_substr完美解决中文截取
要使用到的函数:mb_substr和mb_strlen。
mb_substr使用方法:mb_substr("我是要被截取的中文字符串",开始位置,要截取的长度,字符串的编码);实例:mb_substr("我是要被截取的中文字符串",3,'gbk');结果将是“我是要”;这个函数可以解决字符串中包含中文、英文、数字、字符各种类型的字符串。
在实际使用过程中需要和mb_strlen配合使用,mb_strlen的使用方法和strlen类似,只是多了一个编码参数:mb_strlen("我是要被计算长度的字符","gbk");结果是11。
详细的使用例子:
比如字符串超过20个就需要截取:
if(mb_strlen($str,"gbk") >20)
{
$str = mb_substr($str,20,"gbk");
}
经常面试的时候问你如何实现字符串翻转,第一反应,当然是strrev函数啦,这么容易的题目还放在面试里考,真不嫌麻烦啊?
strrev函数对英文很好用,直接可以实现字符串翻转,但是面对中文呢?肯定都是乱码,对于这样的问题有很多,比如strstr,substr等函数都是这样的。还好PHP提供了mb_类的函数实现不同编码、不同语言之间的相互转换等操作。下面是我写的PHP字符串翻转函数(mb_类的函数需要开启一个mb_string实现)。
function getRev($str,$encoding='utf-8'){
$result = '';
$len = mb_strlen($str);
for($i=$len-1; $i>=0; $i--){
$result .= mb_substr($str,$i,1,$encoding);
}
return $result;
}
$str="我爱博客园"
echo getRev($str);
?>
//输出结果园客博爱我
2 自定义函数
function sysSubStr($string,$length,$append = false)
{
if(strlen($string) <= $length )
{
return $string;
}
else
{
$i = 0;
while ($i < $length)
{
$stringTMP = substr($string,1);
if ( ord($stringTMP) >=224 )
{
$stringTMP = substr($string,3);
$i = $i + 3;
}
elseif( ord($stringTMP) >=192 )
{
$stringTMP = substr($string,2);
$i = $i + 2;
}
else
{
$i = $i + 1;
}
$stringLast[] = $stringTMP;
}
$stringLast = implode("",$stringLast);
if($append)
{
$stringLast .= "...";
}
return $stringLast;
}
}
$string = "编程之家教程 —— 专注于互联网主流的各种技术";
$length = "27";
$append = true;
echo sysSubStr($string,$append);
?>
function mysubstr($str,$start,$len) {
$tmpstr = "";
$strlen = $start + $len;
for($i = 0; $i < $strlen; $i++) {
if(ord(substr($str,1)) > 0xa0) {
$tmpstr .= substr($str,2);
$i++;
} else
$tmpstr .= substr($str,1);
}
return $tmpstr;
}
?>
4.截取utf8编码的多字节字符串:
//截取utf8字符串
function utf8Substr($str,$from,$len)
{
return preg_replace('#^(?:[x00-x7F]|[xC0-xFF][x80-xBF]+){0,'.$from.'}'.
'((?:[x00-x7F]|[xC0-xFF][x80-xBF]+){0,'.$len.'}).*#s',
'$1',$str);
}
?>
/*
cut_str(字符串,截取长度,开始长度,编码);
编码默认为 utf-8
开始长度默认为 0
*/
function cut_str($string,$sublen,$start = 0,$code = 'UTF-8')
{
if($code == 'UTF-8')
{
$pa = "/[x01-x7f]|[xc2-xdf][x80-xbf]|xe0[xa0-xbf][x80-xbf]|[xe1-xef][x80-xbf][x80-xbf]|xf0[x90-xbf][x80-xbf][x80-xbf]|[xf1-xf7][x80-xbf][x80-xbf][x80-xbf]/";
preg_match_all($pa,$string,$t_string);
if(count($t_string[0]) - $start > $sublen) return join('',array_slice($t_string[0],$sublen))."...";
return join('',$sublen));
}
else
{
$sublen = $sublen*2;
$strlen = strlen($string);
$tmpstr = '';
for($i=0; $i< $strlen; $i++)
{
if($i>=$start && $i< ($start+$sublen))
{
if(ord(substr($string,1))>129)
{
$tmpstr.= substr($string,2);
}
else
{
$tmpstr.= substr($string,1);
}
}
if(ord(substr($string,1))>129) $i++;
}
if(strlen($tmpstr)< $strlen ) $tmpstr.= "...";
return $tmpstr;
}
}
$str = "abcd需要截取的字符串";
echo cut_str($str,8,'gb2312');
?>