本文为转载!!
原文链接:http://www.csdn.net/article/2013-12-09/2817755-Twitter-open-source
Twitter被称为“互联网的短信服务”,允许用户发布不超过140个字的微博客,该创意来自Twitter的联合创始人Jack Dorsey,这个在7年前被分析师称为“有史以来最愚蠢”的创意,不料如今已经成为了风靡全世界的社交网络和微博客服务,月活跃用户达到了2.183亿人,每天大约有5亿条推文(tweet)被发送,几乎每秒钟就产生了超过6000条推文。
2013年11月7日,Twitter正式在纽约证券交易所上市,发行价26美元,但开盘即大涨73%至45.1美元。
Twitter可以称之为构建于开源项目之上,该公司开源负责人Chris Aniszczyk表示,如果没有开源软件,Twitter将不会存在,用户在移动端和PC端发送和接收的每一条推文都会需要开源软件。
在Twitter公司,当计划开展一个新项目时,工程师会首先衡量需求以及开源项目的能力,并通过定制开源项目来更好地满足需求。正是如此,Twitter才发展如此迅速,并轻松解决了日益飞速扩增的流量和请求。
Twitter所使用的开源项目
Twitter每天需要处理用户发送的推文数超过4亿条,此外还要处理大量的时间线(来自用户关注的人的所有推文),这一工程是相当浩大和复杂的。Twitter使用了大量的开源项目,从各种工具到各种库。如果没有这些开源项目,日常工作将无法正常运作。
下面来看看推文传递的背后都用到了哪些开源项目。
1. 分析和搜索服务
Twitter的搜索服务每天支持超过10亿次的查询,其背后的开源项目包括:
- Apache Cassandra:一套分布式NoSQL数据库系统,以Amazon专有的完全分布式的Dynamo为基础,结合了Google BigTable基于列族(Column Family)的数据模型,是一个网络社交云计算方面理想的数据库。该项目最初由Facebook开发,于2008开源并捐赠给Apache基金会。
- Apache Hadoop:由Apache基金会所开发的分布式系统基础架构,可使应用程序充分利用集群的威力高速运算和存储,用户可以在不了解分布式底层细节的情况下,开发分布式程序。
- Apache Lucene:一个全文检索引擎工具包,目的是为软件开发人员提供一个简单易用的工具包,以方便的在目标系统中实现全文检索的功能,或者是以此为基础建立起完整的全文检索引擎。
- Apache Pig:一个基于Hadoop的大规模数据分析平台,它提供的类SQL语言称为Pig Latin,该语言的编译器会把类SQL的数据分析请求转换为一系列经过优化处理的MapReduce运算。Pig为复杂的海量数据并行计算提供了一个简单的操作和编程接口。
2. 服务器和存储
Twitter需要将每天用户发送的推文存储到数据库,并推送给其他相关的用户。该过程用到的开源项目包括:
- Linux:主要用于Twitter服务器。
- Memcached:主要用于Twitter的缓存基础设施,作用是加速动态Web应用程序,减轻数据库负载。
- Mysql:流行的开源关系型数据库,被Twitter大量用于存储Twitter消息。
- Node.js:一套用来编写高性能网络服务器的JavaScript工具包,在Twitter中用于队列处理(接收推文并写入数据库),使服务器能处理每个连接而不会阻塞通道。
3. Twitter工程师的工具箱
- Apache Subversion:开源的版本控制系统
- Git:一个分布式的版本控制系统
- Eclipse:大名鼎鼎的Java IDE。
- Gerrit:一个基于Web的代码评审和项目管理的工具,主要面向基于Git版本控制系统的项目
- Jenkins:一个持续集成引擎,主要用于持续、自动地构建/测试软件项目,以及监控一些定时执行的任务
- RSpec:一个BDD 测试工具
4. Twitter背后的编程语言和框架
- OpenJDK:Java的开源版本。Twitter陆续将一些项目从Rails迁移到了Java。
- Python:一种高效的动态解释型Web编程语言。
- Ruby和Ruby on Rails:Twitter最初主要由Ruby和Rails开发。
- Scala:Twitter使用的主要应用编程语言之一,很多Twitter的基础架构都是用Scala编写。
- Clojure:Clojure是一种运行在Java平台上的Lisp方言,在任何具备Java虚拟机的地方,都可以利用Lisp的强大功能。Twitter的大数据处理系统Storm就是基于Clojure。
- Drupal:使用PHP语言编写的开源内容管理框架(CMF),由内容管理系统(CMS)和PHP开发框架共同构成。Twitter的开发者社区基于Drupal构建。
- Sinatra:一个轻量、快速的Ruby开发框架。
5. Twitter的前端解决方案
- jQuery:全球使用最广泛的JavaScript框架。
- Less:一个使用广泛的CSS预处理器,通过简单的语法和变量对CSS进行扩展,可减少很多CSS的代码量。
- MooTools:一个简洁、模块化、面向对象的开源JavaScript框架,为开发者提供了一个跨浏览器的JS解决方案
- Zepto.js:一个轻量级的Javascript框架,主要用于移动开发
6. Twitter服务开发框架
- TwistedMatrix:一个Python 框架,用来开发非阻塞异步的网络服务和应用程序。
- Netty:一个异步的、事件驱动的Web应用框架和工具,用于快速开发高性能、高可靠性的网络服务器和客户端程序。Netty目前作为Twitter的核心队列Kestrel的通信模块。
- Apache Thrift:一个由Facebook开源的远程服务调用框架,采用接口描述语言定义并创建服务,支持可扩展的跨语言服务开发,所包含的代码生成引擎可以在多种语言中创建高效的、无缝的服务。
Twitter公司所开源的项目
Twitter从开源社区中获得了大量的好处,而Twitter也在不断地回馈社区,开源了大量基础设施和工具,使得其他企业和开发者不必重新发明轮子,在这些开源项目的基础上更加快速地实现自己所需。
1. 大数据处理
- scalding:一个用于Cascading的Scala API。Cascading是一个构建于Hadoop上的API,用来创建复杂和容错数据处理工作流,它抽象了集群拓扑结构和配置,允许开发者快速开发复杂分布式的应用,而不用考虑背后的MapReduce。
- summingbird:允许开发者以类似于本地Scala或Java的方式编写MapReduce程序,并在大部分著名的分布式MapReduce平台(包括Storm和Scalding)中执行它们。
2. 前端项目
- Bootstrap:一个用于前端开发的工具包,包含了基本的CSS、HTML组件,包括排版、表单、按钮、表格、网格、导航等。
- TwUI:针对Mac平台的、支持硬件加速的UI框架,受到了UIKit的启发。
- typeahead.js:一个快速、全功能的自动完成库
- hogan.js:一个Mustache模板语言的编译器
3. 后端服务
- Twitter Mysql:Twitter的MySQL分支
- Parquet:一种Twitter内部供Hadoop使用的列式存储格式,为Hadoop生态系统中的所有项目提供支持高效率压缩的列式数据表达,而且与数据处理框架、数据模型或编程语言无关。
- Finagle:一个允许开发者使用Java、Scala或其他JVM语言来构建异步RPC服务器和客户端的库,主要用于Twitter的后端服务。
- iago:一个负载生成器,用来在产品正式发布前做流量负载测试。
- twemproxy:一个快速、轻量级的memcached和redis代理服务器
- zipkin:一个分布式的跟踪系统。在Twitter中用于收集各个服务上的监控数据,并提供查询接口。
4. Twitter基础设施通用库
5. 收购其他公司后开源的项目
Twitter还收购了一些公司,并将这些公司的软件以开源形式发布。
- Storm:这是一个类似于Hadoop的实时数据处理框架,最初由BackType开发,后来BackType被Twitter收购,Twitter将Storm作为其实时数据分析系统。
- Whisper Systems的所有项目:Whisper Systems是一家移动安全初创公司,主要为Android手机和平板用户提供企业级的安全和管理解决方案。Twitter于2011年12月收购该公司,随后宣布将逐步开放Whisper Systems所有软件源代码。
更多的开源项目:http://twitter.github.io/
Twitter内部的开源氛围
1. 比Google更自由
尽管Google也开源了大量的项目,但是其开源程度并没有Twitter彻底。比如在数据中心方面,Google做了大量的保密工作,而在Twitter公司,这些要开放得多,员工自由实验的空间更大。
在一些大型企业中,所使用的软件或系统是相当固定的,员工需要在该基础设施上开发东西。而据Twitter员工透露,Twitter允许员工尝试新的不同的东西,甚至允许使用不同的语言和开源项目来重构Twitter的一些服务。
之前Google“20%的自由时间”为人津津乐道,如今该福利已经取消了。而在Twitter,每季度公司会举办hackweeks,员工可以拿出一周的时间从事各式各样的项目,这些项目不需要和他们每天的职责相关。
2. 在公司内部培训开源技术
2013年8月,Twitter收购了致力于开源技术培训的Marakana公司,成立了Twitter大学(Twitter University),其目的主要是为内部员工提供更丰富的培训资源,同时也希望吸引更好的工程技术人才加入公司。
Twitter大学将陆续向大众开放,Twitter也将部分教育资源放到了网上。比如scala_school(这是针对Scala编程语言的一系列教程)。
Twitter对开源基金会的支持
Twitter也通过资金和代码赞助了一些开源基金会和组织。
- Ada Initiative:一个在技术和文化上支持妇女参与开源技术的组织。
- Apache软件基金会:Twitter工程师也参与贡献了Apache软件基金会的部分项目。
- Eclipse基金会
- JCP:Java社区进程,主要负责制定Java规范和标准。
- Linux基金会:负责协调和推动Linux系统的发展。
- OIN:Open Invention Network(开放创新网络),一个旨在减轻Linux开发人员受到专利诉讼压力的机构。
- OpenJDK:Java的开源实现。
总结
Twitter在2011年就专门成立了一个“开源办公室”,用来支持对Twitter至关重要的开源组织。这足以见得开源对于Twitter的重要性。
Twitter公司开源负责人Chris Aniszczyk称,如果在开源社区花费一些精力,将会意识到信息的开放对于整个世界所带来的积极影响,在Twitter,从内到外都保持着开放的心态和浓厚的开源氛围,而且每个员工都有机会参与其中。同时Twitter对开源社区所做出的伟大工作充满感恩,并将一直和开源社区保持健康的关系。
再来看国内,如今一些大型互联网公司也开始重视开源,在使用开源项目构建基础服务的同时,也不忘回馈开源社区。【企业开源系列】后面也将会聚焦国内开源企业,带领大家认识一个全新的国内开源生态。
更多信息可参考Twitter公司开源负责人Chris Aniszczyk在LinuxCon EU 2013大会上的演讲PPT,以及以及Twitter公司的开源站点。
相关阅读:
相关推荐
【企业开源系列】Twitter:收发一条推文的背后,展示了Twitter如何依赖开源技术构建起全球性的社交网络。Twitter的成功不仅在于其创新的140字符微博形式,更在于其背后强大的技术栈,其中包括一系列关键的开源项目。...
在本项目"Twitter-Sentiment-Analysis:Twitter上特定推文的排序"中,我们将探讨如何利用数据分析和机器学习技术来对Twitter上的推文进行情感分析,并根据其情感极性进行排序。这是一个典型的情感挖掘应用,它可以...
该项目是通过。 可用脚本 在项目目录中,可以运行: npm start 在开发模式下运行应用程序。 打开在浏览器中查看。 如果进行编辑,页面将重新加载。 您还将在控制台中看到任何棉绒错误。... 在交互式监视模式下启动...
Twitter情绪分析使用LSTM 在此笔记本中,我实现了具有嵌入功能的Stacked LSTM,以分析160万条推文,分为三类:1.正面2.负面3.中立,制作了模型来预测新推文的类别,准确度为78%。 表现 精确 记起 F1分数 支持 0 ...
.twitrc),如下所示: [twitter]token = <token>token_key = <token>con_secret = <con>con_secret_key = 这个怎么运作twitforget获取您的推文历史记录列表,并删除除最后n条推文外的所有推文。 您可以使用-k标志...
discord-twitter-webhooks是一种自动化工具,可以检查的新推文,并将其发送到 Webhook。 该bot配置了配置文件或环境变量,并使用Python 3编写。 安装 (单击以展开下面的部分,以获取完整的安装说明) 获取...
**vim-twitter:从vim内部发推文!** `vim-twitter` 是一个 Vim 插件,它允许用户在 Vim 编辑器内部方便地撰写、发送和管理推文。这个插件充分利用了 Vim 的强大功能和命令行界面,使得程序员和 Vim 爱好者无需离开...
标题“crover:刮推特Twitter推文和群集主题词”指的是一个Python工具,用于从Twitter平台抓取推文,并对这些推文中的数据进行分析,特别是通过聚类算法来识别和归类主题词。这个工具可能是开发者或数据分析师用来...
讨厌:NASTY高级搜索推文Yielder
Tw位置 获取Twitter用户推文位置的Python脚本 用 通过产品特点根据纬度和经度获取Twitter用户名个人资料网址鸣叫纬度和经度Google地图链接到经度和纬度用法TwLocation应该可以在运行Python 2.7的所有Linux发行版上...
preprocessing.py :一系列推文清洁和预处理modelling.py :推文矢量化(TF-IDF)和二进制分类模型(多项朴素贝叶斯)探索性数据分析我想弄清楚我们是否可以利用模型中的“位置”和“关键字”列。 关键字分
Loadsmart推文要创建新的tweet,请在此tweets/文件夹中创建一个新的*.tweet文件。例子使用内容创建一个新文件tweets/hello-world.tweet 你好,世界! 最好使用包括当前年份和月份的子文件夹,例如tweets/2020/04/...
`twitterscraper`是一个强大的工具,它允许开发者以编程方式从Twitter获取大量公开可用的数据,包括推文、用户信息和时间线等。 首先,我们需要安装`twitterscraper`库。这可以通过Python的包管理器pip完成: ```...
使用Twitter流API并将推文,用户……存储在NEO4J数据库中。 设定值 本地设置 在您的模块中添加一个local_settings.py文件,其中包含您的twitter API凭据: CONSUMER_TOKEN =“” CONSUMER_SECRET =“” ACCESS_...
在本文中,我们将深入探讨如何使用React来创建一个应用程序,该程序能够加载并显示Twitter的推文。React是JavaScript库,由Facebook开发,用于构建用户界面,尤其适用于单页应用程序。它采用组件化的方式,使得代码...
Twitter到SSB导入将推文从Twitter导入到ssb的脚本,以便将其显示在Patchwork中。 请求您的Twitter存档。 您将通过电子邮件收到一个ZIP文件。 解压缩并在data/js/tweets找到您的推文存档。 应该有一堆看起来像2018_02...
这个项目“twitter-archiver”是一个基于Python的工具,专门用于在发布或收集推文时自动存档。它可以帮助用户保存重要的推文信息,避免信息丢失,尤其是在社交媒体上的信息流动性极强的情况下。 【描述】:...
Twitter是一个全球知名的社交网络平台及微博服务网站,用户可以随时随地通过各种设备发布信息(称为“推文”),并且可以自由选择关注其他用户,以便实时接收他们发布的更新。这种即时性和互动性使得Twitter成为一种...
“Treet:从一堆推文中提取信息。用Java实现(1.7)”这个标题表明我们讨论的是一个项目或工具,名为“Treet”,它的主要功能是从大量的推文数据中提取有用的信息。它使用了Java编程语言,并且特别指出是基于Java 1.7...
twitter分享demo,步骤详解:http://blog.csdn.net/sjx19871225/article/details/8777951