CharTokenizer的简单学习 -

xiaozhou09

浏览: 45796 次

最近访客更多访客>>

justplayoop1

HarborChung

沈寅麟

qq502100724

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

CharTokenizer的简单学习

博客分类：

lucene

一、关系

AttributeSource→TokenStream→Tokenizer

↓

TokenFilter

=============================================

Analyzer中的一个抽象方法是

//属性
private final ReuseStrategy reuseStrategy;
========================================
//TokenStreamComponents
//保存了tokenizer和tokeniStream
//也可以设置Reader
  protected abstract TokenStreamComponents createComponents(String fieldName,Reader reader);
========================================
//得到TokenStream

public final TokenStream tokenStream(final String fieldName,
                                       final Reader reader) throws IOException {
//ReuseStrategy这个内部类是干吗的？
// private CloseableThreadLocal<Object> storedValue = new CloseableThreadLocal<Object>();
//内部抽象类 GlobalReuseStrategy 存放：TokenStreamComponents 
//               PerFieldReuseStrategy存放 Map<String, TokenStreamComponents>         
  private final ReuseStrategy reuseStrategy;
    TokenStreamComponents components = reuseStrategy.getReusableComponents(fieldName);
    final Reader r = initReader(fieldName, reader);
    if (components == null) {
      components = createComponents(fieldName, r);
      reuseStrategy.setReusableComponents(fieldName, components);
    } else {
      components.setReader(r);
    }
    return components.getTokenStream();
  }

分词输出例子：

Analyzer a=new WhitespaceAnalyzer(Version.LUCENE_43);
TokenStream tokenStream=a.tokenStream("CESHI", new StringReader("I LOVE YOU!"));
			
 CharTermAttribute termAttribute = tokenStream.addAttribute(CharTermAttribute.class);

 tokenStream.reset();  //java.lang.ArrayIndexOutOfBoundsException

while(tokenStream.incrementToken()){
    System.out.print("["+termAttribute.toString()+"  
}

二、TokenStream的一些方法和属性

//对于Reader的解析，Token的不断输出
public abstract boolean incrementToken() throws IOException;

public void reset() throws IOException {}

三、Tokenizer的属性和方法

//声明Tokenizer的时候必须有Reader
Reader

四、CharTokenizer

public abstract class CharTokenizer extends Tokenizer {
  
	//tokenizer的属性Reader
  public CharTokenizer(Version matchVersion, Reader input) {
    super(input);
    charUtils = CharacterUtils.getInstance(matchVersion);
  }
  
  public CharTokenizer(Version matchVersion, AttributeFactory factory,
      Reader input) {
    super(factory, input);
    charUtils = CharacterUtils.getInstance(matchVersion);
  }
  
  // note: bufferIndex is -1 here to best-effort AIOOBE consumers that don't call reset()
  //用这些参数的时候必须reset()下 把bufferIndex=0
  //因为第一次处理的时候       if (bufferIndex >= dataLen) 不然reader充值不进来？
  private int offset = 0, bufferIndex = -1, dataLen = 0, finalOffset = 0;
  private static final int MAX_WORD_LEN = 255; //允许单词的最大长度
  private static final int IO_BUFFER_SIZE = 4096;//一次允许的最大的字符数
  
  //添加一些attribute
  private final CharTermAttribute termAtt = addAttribute(CharTermAttribute.class);
  private final OffsetAttribute offsetAtt = addAttribute(OffsetAttribute.class);
  
  //CharacterUtils的方法
  //codePointAt fill
  //通过 Character得到该类提供了几种方法，以确定字符的类别（小写字母，数字，等等），并将字符从大写转换成小写，反之亦然
  private final CharacterUtils charUtils;
  
  //CharacterBuffer的属性
  //char[] buffer; int offset; int length;
  private final CharacterBuffer ioBuffer = CharacterUtils.newCharacterBuffer(IO_BUFFER_SIZE);
  
  //判断是不是token
  protected abstract boolean isTokenChar(int c);

  //当看到小写处理的时候是处理掉了 转换为小写了。
  protected int normalize(int c) {
    return c;
  }
  
  @Override
  public final boolean incrementToken() throws IOException {
	  //这个处理是attributeSource处理的具体纳特state没看懂？
    clearAttributes();
    
    int length = 0;
    int start = -1; // this variable is always initialized
    int end = -1;
    char[] buffer = termAtt.buffer();
    //循环开始？？
    //offset的明白了一点，但是termAtt怎么得到字符的哪？又是怎么得到小写字符的哪？
    while (true) {
    	//把tokenizer的reader的值赋值到ioBuffer里
      if (bufferIndex >= dataLen) {
        offset += dataLen;
        //tokenizer有reader参数
        //实例化analyzer必须实现的方法返回TokenStreamComponents 这个类实现需要tokenizer 属性reader,TokenStream
        //把输入流填充到ioBuffer中
        if(!charUtils.fill(ioBuffer, input)) { // read supplementary char aware with CharacterUtils
          dataLen = 0; // so next offset += dataLen won't decrement offset
          if (length > 0) {
            break;
          } else {
            finalOffset = correctOffset(offset);
            return false;
          }
        }
        //赋值成功的话datLen会得到数据长度
        dataLen = ioBuffer.getLength();
        bufferIndex = 0;
      }
     //赋值成功后判断偏移量的字符  返回给定索引上的 Unicode 代码点
      final int c = charUtils.codePointAt(ioBuffer.getBuffer(), bufferIndex);
     //确定表示指定字符（Unicode 代码点）所需的 char 值的数量 具体也不清楚
      final int charCount = Character.charCount(c);
      bufferIndex += charCount;
      //WhitespaceTokenizer 判断是否是空格
      //如果length>0也跳出了循环
      if (isTokenChar(c)) {               // if it's a token char
          //如果length==0 / start
    	  if (length == 0) {                // start of token
          assert start == -1;
          
          start = offset + bufferIndex - charCount;
          end = start;
        } else if (length >= buffer.length-1) { // check if a supplementary could run out of bounds
          buffer = termAtt.resizeBuffer(2+length); // make sure a supplementary fits in the buffer
        }
        end += charCount;
        length += Character.toChars(normalize(c), buffer, length); // buffer it, normalized
        if (length >= MAX_WORD_LEN) // buffer overflow! make sure to check for >= surrogate pair could break == test
          break;
      } else if (length > 0)             // at non-Letter w/ chars
    	  
        break;                           // return 'em
    }
    termAtt.setLength(length);
    assert start != -1;
   offsetAtt.setOffset(correctOffset(start), finalOffset = correctOffset(end));
    return true;
    
  }
  
  @Override
  public final void end() {
    offsetAtt.setOffset(finalOffset, finalOffset);
  }
//重置属性
  @Override
  public void reset() throws IOException {
    bufferIndex = 0;
    offset = 0;
    dataLen = 0;
    finalOffset = 0;
    ioBuffer.reset(); // make sure to reset the IO buffer!!
  }
}

分享到：

Java调用DOS命令 | Lucene之AttributeImpl源码简单

2013-07-20 21:29
浏览 918
评论(0)
分类:开源软件
查看更多

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

lucene自学: ### Lucene自学知识点详解 #### 一、Lucene概述与基本概念 - **Lucene**：Lucene是一款...通过以上知识点的学习，我们可以了解到Lucene的核心架构及其关键组成部分的工作原理，这对于深入理解和应用Lucene至关重要。

基于智能温度监测系统设计.doc: 基于智能温度监测系统设计.doc

搜广推推荐系统中传统推荐系统方法思维导图整理-完整版: 包括userCF，itemCF，MF，LR，POLY2，FM，FFM，GBDT+LR，阿里LS-PLM 基于深度学习推荐系统（王喆）

2023-04-06-项目笔记 - 第三百五十五阶段 - 4.4.2.353全局变量的作用域-353 -2025.12.22: 2023-04-06-项目笔记-第三百五十五阶段-课前小分享_小分享1.坚持提交gitee 小分享2.作业中提交代码小分享3.写代码注意代码风格 4.3.1变量的使用 4.4变量的作用域与生命周期 4.4.1局部变量的作用域 4.4.2全局变量的作用域 4.4.2.1全局变量的作用域_1 4.4.2.353局变量的作用域_353- 2024-12-22

和美乡村城乡融合发展数字化解决方案.docx: 和美乡村城乡融合发展数字化解决方案.docx

CNN基于Python的深度学习图像识别系统: 基于Python的深度学习图像识别系统是一个利用卷积神经网络（CNN）对图像进行分类的先进项目。该项目使用Python的深度学习库，如TensorFlow，构建和训练一个模型，能够自动识别和分类图像中的对象。系统特别适合于图像处理领域的研究和实践，如计算机视觉、自动驾驶、医疗影像分析等。项目的核心功能包括数据预处理、模型构建、训练、评估和预测。用户可以上传自己的图像或使用预定义的数据集进行训练。系统提供了一个直观的界面，允许用户监控训练进度，并可视化模型的性能。此外，系统还包括了一个模型优化模块，通过调整超参数和网络结构来提高识别准确率。技术层面上，该项目使用了Python编程语言，并集成了多个流行的机器学习库，如NumPy、Pandas、Matplotlib等，用于数据处理和可视化。模型训练过程中，系统会保存训练好的权重，以便后续进行模型评估和预测。用户可以通过简单的API调用，将新的图像输入到训练好的模型中，获取预测结果。

拳皇97.exe拳皇972.exe拳皇973.exe: 拳皇97.exe拳皇972.exe拳皇973.exe

基于python和协同过滤算法的电影推荐系统: 基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法的电影推荐系统基于python和协同过滤算法

DEV-CPP-RED-PANDA: DEV-CPP-RED-PANDA

Python语言求解旅行商（TSP）问题，算法包括禁忌搜索、蚁群算法、模拟退火算法等: Python语言求解旅行商问题，算法包括禁忌搜索、蚁群算法、模拟退火算法等。

pdfjs2.5.207和4.9.155: pdfjs 用于在浏览器中查看/预览/打印pdf。 pdfjs 2.5.207 支持firefox/chrome/edge/ie11以上版本。如果需要支持旧版本浏览器，可以使用这个，是未修改过的原版，支持打印和下载按钮。亲测有效。 pdf 4.9.155分两个包： pdfjs-4.9.155-dist.zip pdfjs-4.9.155-legacy-dist.zip

建设项目现场高温人员中暑事故应急预案.docx: 建设项目现场高温人员中暑事故应急预案

数据结构上机实验大作业-线性表选题.zip: 数据结构上机实验大作业-线性表选题.zip

基于高德地图的校园导航全部资料+详细文档+高分项目.zip: 【资源说明】基于高德地图的校园导航全部资料+详细文档+高分项目.zip 【备注】 1、该项目是个人高分项目源码，已获导师指导认可通过，答辩评审分达到95分 2、该资源内项目代码都经过测试运行成功，功能ok的情况下才上传的，请放心下载使用！ 3、本项目适合计算机相关专业(人工智能、通信工程、自动化、电子信息、物联网等)的在校学生、老师或者企业员工下载使用，也可作为毕业设计、课程设计、作业、项目初期立项演示等，当然也适合小白学习进阶。 4、如果基础还行，可以在此代码基础上进行修改，以实现其他功能，也可直接用于毕设、课设、作业等。欢迎下载，沟通交流，互相学习，共同进步！

全自动批量建站快速养权重站系统【纯静态html站群版】：(GPT4.0自动根据关键词写文章+自动发布+自定义友链+自动文章内链+20%页面加提权词): 【静态站群程序视频演示，只有视频，不含程序，下载须知】【静态站群程序视频演示，只有视频，不含程序，下载须知】全自动批量建站快速养权重站系统【纯静态html站群版】：(GPT4.0自动根据关键词写文章+自动发布+自定义友链+自动文章内链+20%页面加提权词)

9.30 SWKJ 男头7张+女头2张.zip: 9.30 SWKJ 男头7张+女头2张.zip

基于java+springboot+vue+mysql的技术交流和分享平台源码+数据库+论文(高分毕业设计).zip: 项目已获导师指导并通过的高分毕业设计项目，可作为课程设计和期末大作业，下载即用无需修改，项目完整确保可以运行。包含：项目源码、数据库脚本、软件工具等，该项目可以作为毕设、课程设计使用，前后端代码都在里面。该系统功能完善、界面美观、操作简单、功能齐全、管理便捷，具有很高的实际应用价值。项目都经过严格调试，确保可以运行！可以放心下载技术组成语言：java 开发环境：idea、vscode 数据库：MySql5.7以上部署环境：maven 数据库工具：navicat

一个通过单片机在各种屏幕上显示中文的解决方案.7z: 一个通过单片机在各种屏幕上显示中文的解决方案.7z

Halcon模板匹配图像包: 图像

线上辅导班系统-JAVA-基于springboot的线上辅导班系统的开发与设计（毕业论文）: 一、用户管理功能用户注册与登录学生注册：学生可以通过手机号、邮箱、社交账号等方式注册，填写个人信息（如姓名、年龄、学校等）。家长/监护人账户：支持家长/监护人注册并管理学生账户，查看学习进度和成绩。教师账户：教师可以注册并设置个人资料，上传资质认证文件。管理员账户：管理员负责整个系统的管理，包括用户管理、课程管理、平台设置等。用户权限管理角色权限：系统根据用户类型（学生、家长、教师、管理员）分配不同权限，确保信息安全。家长监督：家长可以查看子女的学习进度、成绩和教师反馈，参与学习监督。个人资料管理用户可以在个人中心更新基本信息，设置个人头像、联系方式、密码等。支持学籍信息的维护，例如学生的年级、班级、课程历史等。二、课程管理功能课程设置课程创建与编辑：教师或管理员可以创建和编辑课程内容，上传课件、视频、文档等教学材料。课程分类：根据学科、年级、难度等维度进行课程分类，方便学生浏览和选择。课程排课：管理员可以设置课程的时间表、教学内容和授课教师，并调整上课时间和频率。课程安排与通知课程预约：学生可以在线选择并预约感兴趣的课程，系统根据学生的时

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论

CharTokenizer的简单学习

评论

发表评论

相关推荐

Luene的1.4.3中的indexwriter简单分析

lucene之indexwriter 简单分析

AttributeSource内容简答分析

Lucene之AttributeImpl源码简单

lucene 尝试分析TokenStream（一）

lucene设置高亮

内容解析工具：TIKA

Lucene 扩展QueryParse

Lucene匹配所有的信息Collector

lucene跨度域查询（一）

lucene的一些过滤器

Lucene的简单查询(二)

Lucene的基本分词过程

Lucene的简单查询

初识lucene-增删改查（三）

初识lucene（二）

初识lucene（一）

最近访客更多访客>>