`

php字符串截取(UTF-8/GB2312)

 
阅读更多

1. 截取GB2312中文字符串

<?php
< ?php 
//截取中文字符串
function mysubstr($str, $start, $len) {
    $tmpstr = "";
    $strlen = $start + $len;
    for($i = 0; $i < $strlen; $i++) {
        if(ord(substr($str, $i, 1)) > 0xa0) {
            $tmpstr .= substr($str, $i, 2);
            $i++;
        } else
            $tmpstr .= substr($str, $i, 1);
    }
    return $tmpstr;
}
?>

2. 截取utf8编码的多字节字符串

<?php
< ?php
//截取utf8字符串
function utf8Substr($str, $from, $len)
{
    return preg_replace('#^(?:[\x00-\x7F]|[\xC0-\xFF][\x80-\xBF]+){0,'.$from.'}'.
                       '((?:[\x00-\x7F]|[\xC0-\xFF][\x80-\xBF]+){0,'.$len.'}).*#s',
                       '$1',$str);
}
?>
3. UTF-8、GB2312都支持的汉字截取函数

<?php
< ?php
/* 
Utf-8、gb2312都支持的汉字截取函数 
cut_str(字符串, 截取长度, 开始长度, 编码); 
编码默认为 utf-8 
开始长度默认为 0 
*/ 
 
function cut_str($string, $sublen, $start = 0, $code = 'UTF-8') 

    if($code == 'UTF-8') 
    { 
        $pa = "/[\x01-\x7f]|[\xc2-\xdf][\x80-\xbf]|\xe0[\xa0-\xbf][\x80-\xbf]|[\xe1-\xef][\x80-\xbf][\x80-\xbf]|\xf0[\x90-\xbf][\x80-\xbf][\x80-\xbf]|[\xf1-\xf7][\x80-\xbf][\x80-\xbf][\x80-\xbf]/"; 
        preg_match_all($pa, $string, $t_string); 
 
        if(count($t_string[0]) - $start > $sublen) return join('', array_slice($t_string[0], $start, $sublen))."...";
        return join('', array_slice($t_string[0], $start, $sublen)); 
    } 
    else 
    { 
        $start = $start*2; 
        $sublen = $sublen*2; 
        $strlen = strlen($string); 
        $tmpstr = ''; 
 
        for($i=0; $i< $strlen; $i++) 
        { 
            if($i>=$start && $i< ($start+$sublen)) 
            { 
                if(ord(substr($string, $i, 1))>129) 
                { 
                    $tmpstr.= substr($string, $i, 2); 
                } 
                else 
                { 
                    $tmpstr.= substr($string, $i, 1); 
                } 
            } 
            if(ord(substr($string, $i, 1))>129) $i++; 
        } 
        if(strlen($tmpstr)< $strlen ) $tmpstr.= "..."; 
        return $tmpstr; 
    } 

 
$str = "abcd需要截取的字符串"; 
echo cut_str($str, 8, 0, 'gb2312'); 
?>
4. BugFree 的字符截取函数

<?php
< ?php 
/** 
 * @package     BugFree 
 * @version     $Id: FunctionsMain.inc.php,v 1.32 2005/09/24 11:38:37 wwccss Exp $ 
 * 
 * 
 * Return part of a string(Enhance the function substr()) 
 * 
 * @author                  Chunsheng Wang <wwccss@263.net
 * @param string  $String  the string to cut. 
 * @param int     $Length  the length of returned string. 
 * @param booble  $Append  whether append "...": false|true 
 * @return string           the cutted string. 
 */ 
function sysSubStr($String,$Length,$Append = false) 

    if (strlen($String) < = $Length ) 
    { 
        return $String; 
    } 
    else 
    { 
        $I = 0; 
        while ($I < $Length) 
        { 
            $StringTMP = substr($String,$I,1); 
            if ( ord($StringTMP) >=224 ) 
            { 
                $StringTMP = substr($String,$I,3); 
                $I = $I + 3; 
            } 
            elseif( ord($StringTMP) >=192 ) 
            { 
                $StringTMP = substr($String,$I,2); 
                $I = $I + 2; 
            } 
            else 
            { 
                $I = $I + 1; 
            } 
            $StringLast[] = $StringTMP; 
        } 
        $StringLast = implode("",$StringLast); 
        if($Append) 
        { 
            $StringLast .= "..."; 
        } 
        return $StringLast; 
    } 

 
$String = "CodeBit.cn -- 简单、精彩、通用"; 
$Length = "18"; 
$Append = false; 
echo sysSubStr($String,$Length,$Append); 
?>

分享到:
评论

相关推荐

    PHP 字符串编码截取函数(兼容utf-8和gb2312)

    若为gb2312,先将其转为utf-8,在utf-8的基础上截取然后再转换回来 function cut_string($str,$from=1,$length=10,$code=’utf-8′,$rear=’…’){ if($code!=’utf-8′){//总是将字符串转为utf-8编码 $str=iconv($...

    php字符串截取.pdf

    本文详细介绍了三种不同的PHP字符串截取方法,分别适用于GB2312和UTF-8编码的字符串。这些方法能够帮助开发者根据实际需要选择合适的方式处理字符串,特别是在中文环境下更为实用。掌握这些技巧对于提升PHP开发效率...

    php_web项目中utf-8的问题.do

    如果PHP文件本身就是UTF-8编码,则需要使用`iconv("UTF-8","GB2312","$filename")`将文件名转换为GB2312编码。 5. **文章标题截断时的乱码问题** 对于过长的文章标题,在前端显示时可能需要进行截断。然而,由于...

    php中截取字符串支持utf-8

    然而,默认情况下,PHP中的`substr`函数并不支持直接截取UTF-8编码的字符串。因此,为了正确处理UTF-8字符串,我们需要使用专门针对UTF-8设计的方法或函数。 ### 二、基本示例:使用自定义函数实现UTF-8字符串截取 ...

    php字符串截取[文].pdf

    ### PHP字符串截取详解 #### 一、GB2312中文字符串截取方法解析 在处理中文字符串时,特别是对于较旧的编码格式如GB2312,我们需要特别注意字符的编码方式以避免截取后出现乱码。下面详细介绍了一个针对GB2312编码...

    PHP 截取字符串函数整理(支持gb2312和utf-8)

    2. 截取UTF-8编码的字符串 对于UTF-8编码的字符串,由于UTF-8是一种变长的编码方式,一个字符可能由1到4个字节组成,这使得截取处理变得更加复杂。可以使用正则表达式结合preg_replace()函数来实现对UTF-8编码字符串...

    php自定义截取中文字符串-utf8版

    本篇主要介绍如何自定义截取UTF-8编码下的中文字符串。 在UTF-8编码中,一个中文字符通常由3个字节组成,而英文字符、数字或一些特殊符号只占1个字节。因此,常规的字符串截取函数(如`substr()`)在处理中文字符串...

    php截取字符串[文].pdf

    由于其复杂性,截取UTF-8字符串时需要确保不会截断中间的字节。以下是一个使用正则表达式的示例。 ```php // 截取utf8字符串 function utf8Substr($str, $from, $len) { return preg_replace( '#^(?:[\x00-\x7F]|...

    php smarty截取中文字符乱码问题?gb2312/utf-8

    乱码问题的核心在于字符编码不一致,常见的编码有GB2312和UTF-8。GB2312编码的中文字符占用两个字节,而UTF-8编码的中文字符可能占用三个或更多字节。如果页面的编码方式和数据的编码方式不匹配,就容易出现乱码。 ...

    PHP 截取字符串 分别适合GB2312和UTF8编码情况

    正确地截取UTF-8字符串需要一个能够识别字节序列正确性的函数。示例中给出了`utf8Substr`函数,这个函数使用正则表达式来匹配和截取指定长度的UTF-8编码字符串。使用正则表达式的方法可以有效地处理不同长度的字符...

    php截取字符串.docx

    本文将详细探讨几种常用的PHP字符串截取方法,包括针对不同编码(如GB2312、UTF-8)的字符串截取技巧,并提供实际代码示例。 #### 1. 截取GB2312编码的中文字符串 GB2312是一种用于简体中文的编码方式,当需要从GB...

    收集整理的非常有用的PHP函数

    //加密解密 ... Utf-8、gb2312都支持的汉字截取函数 cut_str(字符串, 截取长度, 开始长度, 编码); 编码默认为 utf-8 开始长度默认为 0 */ //获取用户真实IP //防止注入 //页面提示跳转 //时间长度转换

    php自定义中文字符串截取函数substr_for_gb2312及substr_for_utf8示例

    这两个自定义函数对于处理中文字符串截取的问题非常有用,尤其是在处理用户输入或者从数据库读取GBK或UTF-8编码的中文数据时,可以有效地防止因编码问题导致的乱码。它们体现了PHP在处理多字节编码字符串时的灵活性...

    多个PHP中文字符串截取函数

    `utf8Substr` 函数使用正则表达式来截取UTF-8编码的多字节字符串。正则表达式匹配指定范围内的UTF-8字符,并仅返回这些字符,从而实现了字符串的截取。 最后,`cut_str` 函数是一个通用的汉字截取函数,支持UTF-8和...

    php中文字符串截取多种方法汇总

    以下是一个使用正则表达式截取UTF-8字符串的示例: ```php function utf8Substr($str, $from, $len) { return preg_replace('#^(?:[\x00-\x7F]|[\xC0-\xFF][\x80-\xBF]+){0,'.$from.'}'. '((?:[\x00-\x7F]|[\xC0-\...

    网站开发中遇到UTF8出现乱码问题.pdf

    4. 当PHP以附件形式保存文件,特别是文件名包含中文时,需要将UTF-8编码的文件名转换为GB2312,例如使用iconv函数:`iconv("UTF-8", "GB2312", "$filename");` 5. 截断文章标题时,由于UTF-8中文字符占3个字节,可能...

Global site tag (gtag.js) - Google Analytics