阅读 19552 次
发表时间:2010-10-02

 

  大数据量的问题是很多面试笔试中经常出现的问题,比如baidu google 腾讯 这样的一些涉及到海量数据的公司经常会问到。
  下面的方法是我对海量数据的处理方法进行了一个一般性的总结,当然这些方法可能并不能完全覆盖所有的问题,但是这样的一些方法也基本可以处理绝大多数遇到的问题。下面的一些问题基本直接来源于公司的面试笔试题目,方法不一定最优,如果你有更好的处理方法,欢迎与我讨论。


  本贴从解决这类问题的方法入手,开辟一系列专题来解决海量数据问题。拟包含 以下几个方面。
  1. Bloom Filter
  2. Hash
  3. Bit-Map
  4. 双层桶划分
  5. 数据库索引
  6. 倒排索引(Inverted Index)
  7. 外排序
  8. Trie树
  9. MapReduce

  在这些解决方案之上,再借助一定的例子来剖析海量数据处理问题的解决方案。

 

其实在坛子里里面好多类似的面试题都可以用这样的方法来解答,比如百度的TopK热门查询问题,某日IP最多访问问题。

把这类问题研究好了,面试像百度,腾讯这样的公司就完全没问题了!!!

发表时间:2010-10-02
您正在访问的网站被限制访问,限制的原因是:Websense 类别“禁止员工访问-blog”已筛选。

能否贴出来???
发表时间:2010-10-02
ouchxp 写道
您正在访问的网站被限制访问,限制的原因是:Websense 类别“禁止员工访问-blog”已筛选。

能否贴出来???


我现在也访问不了,我的百度空间有备份 
<>海量数据处理专题(二)——Bloom Filter:http://hi.baidu.com/08%B5%BD%B1%B1%BE%A9/blog/item/c9de6e542d1576113b293538.html
海量数据处理专题(三)——Hash:http://hi.baidu.com/08%B5%BD%B1%B1%BE%A9/blog/item/9daf7b25091fcc6e34a80feb.html
海量数据处理专题(四)——Bit-map:http://hi.baidu.com/08%B5%BD%B1%B1%BE%A9/blog/item/abd9363f6cbb34cc7d1e71f4.html
发表时间:2010-10-02
pkuoliver 写道
ouchxp 写道
您正在访问的网站被限制访问,限制的原因是:Websense 类别“禁止员工访问-blog”已筛选。

能否贴出来???


我现在也访问不了,我的百度空间有备份 
<>海量数据处理专题(二)——Bloom Filter:http://hi.baidu.com/08%B5%BD%B1%B1%BE%A9/blog/item/c9de6e542d1576113b293538.html
海量数据处理专题(三)——Hash:http://hi.baidu.com/08%B5%BD%B1%B1%BE%A9/blog/item/9daf7b25091fcc6e34a80feb.html
海量数据处理专题(四)——Bit-map:http://hi.baidu.com/08%B5%BD%B1%B1%BE%A9/blog/item/abd9363f6cbb34cc7d1e71f4.html

找个代理应该可以。
发表时间:2010-10-03
文章是好东西。
但这个貌似在csdn上 cnblogs都出现过啊。
不知道是原创 还是转载,注明下比较好
发表时间:2010-10-06
总结的挺全的,值得学习。
发表时间:2010-10-07
及时啊,周一面试可能用得上。
发表时间:2010-10-07
不过内容好像不是原创的。其他地方见过
发表时间:2010-10-07
天堂友人 写道
不过内容好像不是原创的。其他地方见过

能找到原文吗?
发表时间:2010-10-08
ouchxp 写道
您正在访问的网站被限制访问,限制的原因是:Websense 类别“禁止员工访问-blog”已筛选。

能否贴出来???


话说这位网友是东软员工?
Global site tag (gtag.js) - Google Analytics