linux 同步IO: sync、fsync与fdatasync

elf8848

浏览: 7206708 次
性别:
来自: 北京

最近访客更多访客>>

wathking

fuwuwaibao123

winicecold

zhaoshijie

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

博客分类：

传统的UNIX实现在内核中设有缓冲区高速缓存或页面高速缓存，大多数磁盘I/O都通过缓冲进行。当将数据写入文件时，内核通常先将该数据复制到其中一个缓冲区中，如果该缓冲区尚未写满，则并不将其排入输出队列，而是等待其写满或者当内核需要重用该缓冲区以便存放其他磁盘块数据时，再将该缓冲排入输出队列，然后待其到达队首时，才进行实际的I/O操作。这种输出方式被称为延迟写（delayed write）（Bach [1986]第3章详细讨论了缓冲区高速缓存）。
延迟写减少了磁盘读写次数，但是却降低了文件内容的更新速度，使得欲写到文件中的数据在一段时间内并没有写到磁盘上。当系统发生故障时，这种延迟可能造成文件更新内容的丢失。为了保证磁盘上实际文件系统与缓冲区高速缓存中内容的一致性，UNIX系统提供了sync、fsync和fdatasync三个函数。
sync函数只是将所有修改过的块缓冲区排入写队列，然后就返回，它并不等待实际写磁盘操作结束。
通常称为update的系统守护进程会周期性地（一般每隔30秒）调用sync函数。这就保证了定期冲洗内核的块缓冲区。命令sync(1)也调用sync函数。
fsync函数只对由文件描述符filedes指定的单一文件起作用，并且等待写磁盘操作结束，然后返回。fsync可用于数据库这样的应用程序，这种应用程序需要确保将修改过的块立即写到磁盘上。
fdatasync函数类似于fsync，但它只影响文件的数据部分。而除数据外，fsync还会同步更新文件的属性。

对于提供事务支持的数据库，在事务提交时，都要确保事务日志（包含该事务所有的修改操作以及一个提交记录）完全写到硬盘上，才认定事务提交成功并返回给应用层。

一个简单的问题：在*nix操作系统上，怎样保证对文件的更新内容成功持久化到硬盘？

1. write不够，需要fsync

一般情况下，对硬盘（或者其他持久存储设备）文件的write操作，更新的只是内存中的页缓存（page cache），而脏页面不会立即更新到硬盘中，而是由操作系统统一调度，如由专门的flusher内核线程在满足一定条件时（如一定时间间隔、内存中的脏页达到一定比例）内将脏页面同步到硬盘上（放入设备的IO请求队列）。

因为write调用不会等到硬盘IO完成之后才返回，因此如果OS在write调用之后、硬盘同步之前崩溃，则数据可能丢失。虽然这样的时间窗口很小，但是对于需要保证事务的持久化（durability）和一致性（consistency）的数据库程序来说，write()所提供的“松散的异步语义”是不够的，通常需要OS提供的同步IO（synchronized-IO）原语来保证：

1 #include <unistd.h>
2 int fsync(int fd);

fsync的功能是确保文件fd所有已修改的内容已经正确同步到硬盘上，该调用会阻塞等待直到设备报告IO完成。

PS：如果采用内存映射文件的方式进行文件IO（使用mmap，将文件的page cache直接映射到进程的地址空间，通过写内存的方式修改文件），也有类似的系统调用来确保修改的内容完全同步到硬盘之上：

1 #incude <sys/mman.h>
2 int msync(void *addr, size_t length, int flags)

msync需要指定同步的地址区间，如此细粒度的控制似乎比fsync更加高效（因为应用程序通常知道自己的脏页位置），但实际上（Linux）kernel中有着十分高效的数据结构，能够很快地找出文件的脏页，使得fsync只会同步文件的修改内容。

2. fsync的性能问题，与fdatasync

除了同步文件的修改内容（脏页），fsync还会同步文件的描述信息（metadata，包括size、访问时间st_atime & st_mtime等等），因为文件的数据和metadata通常存在硬盘的不同地方，因此fsync至少需要两次IO写操作，fsync的man page这样说：

"Unfortunately fsync() will always initialize two write operations : one for the newly written data and another one in order to update the modification time stored in the inode. If the modification time is not a part of the transaction concept fdatasync() can be used to avoid unnecessary inode disk write operations."

多余的一次IO操作，有多么昂贵呢？根据Wikipedia的数据，当前硬盘驱动的平均寻道时间（Average seek time）大约是3~15ms，7200RPM硬盘的平均旋转延迟（Average rotational latency）大约为4ms，因此一次IO操作的耗时大约为10ms左右。这个数字意味着什么？下文还会提到。

Posix同样定义了fdatasync，放宽了同步的语义以提高性能：

1 #include <unistd.h>
2 int fdatasync(int fd);

fdatasync的功能与fsync类似，但是仅仅在必要的情况下才会同步metadata，因此可以减少一次IO写操作。那么，什么是“必要的情况”呢？根据man page中的解释：

"fdatasync does not flush modified metadata unless that metadata is needed in order to allow a subsequent data retrieval to be corretly handled."

举例来说，文件的尺寸（st_size）如果变化，是需要立即同步的，否则OS一旦崩溃，即使文件的数据部分已同步，由于metadata没有同步，依然读不到修改的内容。而最后访问时间(atime)/修改时间(mtime)是不需要每次都同步的，只要应用程序对这两个时间戳没有苛刻的要求，基本无伤大雅。

PS：open时的参数O_SYNC/O_DSYNC有着和fsync/fdatasync类似的语义：使每次write都会阻塞等待硬盘IO完成。（实际上，Linux对O_SYNC/O_DSYNC做了相同处理，没有满足Posix的要求，而是都实现了fdatasync的语义）相对于fsync/fdatasync，这样的设置不够灵活，应该很少使用。

3. 使用fdatasync优化日志同步

文章开头时已提到，为了满足事务要求，数据库的日志文件是常常需要同步IO的。由于需要同步等待硬盘IO完成，所以事务的提交操作常常十分耗时，成为性能的瓶颈。

在Berkeley DB下，如果开启了AUTO_COMMIT（所有独立的写操作自动具有事务语义）并使用默认的同步级别（日志完全同步到硬盘才返回），写一条记录的耗时大约为5~10ms级别，基本和一次IO操作（10ms）的耗时相同。

我们已经知道，在同步上fsync是低效的。但是如果需要使用fdatasync减少对metadata的更新，则需要确保文件的尺寸在write前后没有发生变化。日志文件天生是追加型（append-only）的，总是在不断增大，似乎很难利用好fdatasync。

且看Berkeley DB是怎样处理日志文件的：

1.每个log文件固定为10MB大小，从1开始编号，名称格式为“log.%010d"

2.每次log文件创建时，先写文件的最后1个page，将log文件扩展为10MB大小

3.向log文件中追加记录时，由于文件的尺寸不发生变化，使用fdatasync可以大大优化写log的效率

4.如果一个log文件写满了，则新建一个log文件，也只有一次同步metadata的开销

分享到：

正确的使用dd进行磁盘读写速度测试 | Stom概念

2014-07-07 11:22
浏览 11899
评论(0)
分类:操作系统
查看更多

发表评论

您还没有登录,请您登录后再发表评论

相关推荐

函数sync、fsync与fdatasync的总结整理(必看篇): 在IT领域，尤其是在操作系统和文件系统管理中，`sync`、`fsync`和`fdatasync`是三个至关重要的函数，它们用于确保数据的安全写入和系统一致性。以下是这三个函数的详细说明： 1. **sync函数**： `sync`函数的作用...

《GNU_Linux环境高级编程》.pdf: 紧接着，课程深入到同步内核缓冲区的知识，讲解了sync、fsync和fdatasync函数的使用，这些函数涉及到文件数据的持久化操作，保证了数据能够及时且正确地写入磁盘。这对于理解Linux的文件系统以及保证数据的一致性...

c++面试题网络编程篇: 本文总结了C++面试题网络编程篇中的重要知识点，包括dup和dup2函数、lseek函数、sync、fsync和fdatasync函数、fcntl函数、exit和_exit函数、setjmp和longjmp函数、记录锁、守护进程编程规范等。 1. dup和dup2函数 ...

网络技术-文件服务器-远程访问-个人应用实践Flask-Fi-1744736795.zip: java入门 - 方法的使用网络技术_文件服务器_远程访问_个人应用实践Flask_Fi_1744736795.zip

光伏系统中基于MPPT算法与PI双闭环控制的48V直流输出稳定性优化: 内容概要：本文深入探讨了光伏系统中用于稳定直流输出电压的关键技术，主要包括最大功率点跟踪(MPPT)算法、Boost升压电路和电池侧电压电流PI双闭环控制。MPPT算法通过实时监测光伏板的电压和电流，调整电路工作状态使光伏板始终处于最大功率点附近。Boost电路负责将光伏板输出的较低电压提升到所需的较高电压水平。而电池侧的电压电流PI双闭环控制系统，则确保电池在充放电过程中保持稳定。文中还提供了具体的Python代码示例，展示了这些技术的实际应用方法。适合人群：从事光伏系统设计、开发与维护的专业技术人员，尤其是对提高光伏系统效率感兴趣的工程师。使用场景及目标：适用于需要构建高效稳定的光伏发电系统的场合，旨在通过优化MPPT算法、Boost电路设计和电池管理策略，实现光伏系统直流输出电压的稳定性和可靠性。其他说明：文中不仅介绍了理论概念和技术细节，还给出了实际编码实例，帮助读者更好地理解和掌握相关技术的应用。此外，强调了各组件之间的协调运作对于整个系统性能的重要性。

基于ssm+jsp的手办商城管理系统(源码+数据库)-268: 基于ssm+jsp的手办商城管理系统：前端 jsp、jquery、bootstrap，后端 maven、springmvc、spring、mybatis；角色分为管理员、用户；集成商品信息、购物车、我的订单、客服、商品管理等功能于一体的系统。 ## 环境 - IntelliJ IDEA 2021.3 - Mysql 5.7.26 - Tomcat 7.0.73 - JDK 1.8

基于springboot的高校教育综合管理系统(源码+数据库)231: 基于springboot的高校教育综合管理系统：前端 html、jquery、layui，后端 maven、springmvc、spring、mybatis；角色分为管理员、老师、学生；集成宿舍管理、教评管理、排课管理、考试管理等功能于一体的系统。 ## 环境 - IntelliJ IDEA 2021.3 - Mysql 5.7.26 - JDK 1.8

【医疗人工智能】基于NCCN指南的乳腺癌个性化治疗计划：Agentic-RAG与Graph-RAG方法性能对比及临床应用评估AI驱动的方法: 内容概要：本文介绍了一种基于NCCN（国家综合癌症网络）指南的人工智能工具，用于为乳腺癌患者提供个性化治疗方案。研究提出了两种AI驱动的方法：Agentic-RAG（检索增强生成）和Graph-RAG。Agentic-RAG通过三个步骤选择临床标题、检索匹配的JSON内容并迭代优化推荐，确保治疗建议的准确性。Graph-RAG则将JSON数据转换为文本并通过大型语言模型（LLM）进行总结，再映射成图结构表示关键治疗关系，最终生成推荐。实验结果显示，Agentic-RAG实现了100%的指南依从率，无幻觉或错误治疗；Graph-RAG达到95.8%的依从率，仅有一例错误治疗。两者均提供了详细的治疗建议，并引用了具体的NCCN文档页码。; 适合人群：从事肿瘤学研究和临床工作的医生、研究人员以及对AI在医疗领域应用感兴趣的科技工作者。; 使用场景及目标：①帮助医生快速获取符合NCCN指南的个性化乳腺癌治疗方案；②提高医生对复杂治疗指南的理解和应用效率；③支持临床决策，确保治疗方案的准确性和透明度。; 其他说明：研究强调了Agentic-RAG和Graph-RAG在处理复杂医学指南方面的优势，特别是在提供详细、可追溯的治疗建议方面。未来的工作将扩展测试范围，涵盖更多类型的癌症，并评估系统在实际临床环境中的表现。此外，系统与电子健康记录（EHR）的集成将进一步提升其临床应用价值。

MATLAB实现K-Medoids聚类算法及其应用: 内容概要：本文详细介绍了K-Medoids聚类算法的MATLAB实现，涵盖了数据导入、算法核心逻辑、可视化展示等多个方面。首先，通过鸢尾花数据集展示了如何导入数据并进行初步处理。接着，深入讲解了K-Medoids算法的关键步骤，如选择初始medoids、计算距离矩阵、分配样本到最近的medoid以及更新medoids。文中还强调了该算法相较于K-Means的优势，即对异常点更为稳健。最后，通过可视化手段展示了聚类结果，帮助读者更好地理解和验证算法的效果。适合人群：具有一定MATLAB编程基础的研究人员、数据科学家和机器学习爱好者。使用场景及目标：适用于需要对数据进行稳健聚类分析的场景，特别是当数据集中可能存在异常点时。目标是通过实际案例和代码实现，帮助读者掌握K-Medoids算法的工作原理及其应用场景。其他说明：文中提供了详细的代码片段和解释，便于读者动手实践。同时提醒了一些常见的注意事项，如初始medoids的选择和距离矩阵的计算效率等问题。

基于springboot的学生选课管理系统(源码+数据库)-265: 基于springboot的学生选课管理系统：前端 vue2、elementui，后端 maven、springmvc、spring、mybatis；角色分为管理员、学生、老师；集成课程信息、校园论坛、校园公告、选课等功能于一体的系统。 ## 环境 - IntelliJ IDEA 2021.3 - Mysql 5.7.26 - Node 14.14.0 - JDK 1.8

基于ssm的物流快递管理系统(源码+数据库)216: 基于ssm的物流快递管理系统：前端 jsp、jquery、easyui，后端 springmvc、spring、mybatis；角色分为管理员、用户；集成在线下单、新闻资讯、订单管理等功能于一体的系统。 ## 功能介绍 ### 网站前台 - 网站首页：主导航栏，轮播图，新闻资讯，服务介绍 - 在线下单：填写发货人和收货人信息，提交订单，按快递单号查询快递明细 - 新闻资讯：资讯信息列表展示，资讯详情 ### 管理后台 - 菜单管理：菜单信息的增删改查 - 角色管理：角色信息的增删改查，编辑权限 - 用户列表：用户信息的增删改查，角色分配 - 新闻管理：新闻信息的增删改查，新闻内容支持富文本编辑 - 留言列表：列表信息的列表查询，信息删除，信息编辑，按姓名和联系方式模糊查询 - 订单管理：订单信息的增删改查，多条件查询，更新订单状态 ## 环境 - IntelliJ IDEA 2021.3 - Mysql 5.7.26 - Tomcat 7.0.73 - JDK 1.8

### 【人工智能应用开发】基于Dify的多场景AI应用开发实战指南：从聊天助手到企业知识库构建: 内容概要：本文档《Dify_实战指南.pdf》介绍了Dify这一多合一的数据处理与分析平台，旨在简化AI应用开发流程。Dify通过提供可视化的界面和模块化设计，支持多种大语言模型，具备私有化部署与数据安全保障，拥有活跃的开发者社区。文档详细阐述了Dify的设计初衷、核心理念、应用场景、主要功能及其开发实战案例，如聊天助手、企业知识库和小红书运营工作流。; 适合人群：具备一定编程基础，对AI应用开发感兴趣的开发者、数据科学家及技术爱好者。; 使用场景及目标：①简化AI应用开发流程，支持多种大语言模型；②提供模块化设计与功能组件，实现快速迭代与创新；③确保数据安全，支持私有化部署；④通过实战案例掌握Dify的实际应用技巧。; 其他说明：文档强调Dify的开源特性、低代码/无代码开发、全面模型支持、功能组件丰富等特点，鼓励开发者利用Dify的工具和社区资源，降低AI应用开发门槛，加速从概念到产品的转化过程。

基于树莓派的微信机器人.zip: 基于树莓派的微信机器人

基于ssm+jsp的虚拟商品管理系统(源码+数据库)241: 基于ssm+jsp的虚拟商品管理系统：前端 jsp、jquery，后端 maven、springmvc、spring、mybatis；角色分为管理员、用户；集成促销商品、商品购买、购物车、订单查询等功能于一体的系统。 ## 环境 - IntelliJ IDEA 2021.3 - Mysql 5.7.26 - Tomcat 7.0.73 - JDK 1.8

自动驾驶路径跟踪：基于二自由度横摆动力学的MPC控制实现双移线和单移线路径: 内容概要：本文详细介绍了基于二自由度横摆动力学模型的模型预测控制（MPC）在自动驾驶路径跟踪中的应用，特别是针对双移线和单移线路径的跟踪。首先，文章解释了如何自定义期望轨迹并导入轨迹数据，接着讨论了Q矩阵和R矩阵的作用以及如何调整它们以优化侧向位置跟踪和前轮转角曲线的效果。此外，还探讨了输出值边界的约束设置，确保系统的稳定性和可行性。最后，文章提到了模型的仿真效果，并分享了一些实战经验和参数调整技巧，如预测时域的选择和曲率补偿的应用。适合人群：从事自动驾驶研究的技术人员、对路径跟踪算法感兴趣的工程师和研究人员。使用场景及目标：适用于自动驾驶汽车的研发过程中，特别是在路径规划和控制模块的设计阶段。目标是提高路径跟踪的精确度和平滑性，确保车辆能够在复杂路况下安全行驶。其他说明：文中提供了多个代码示例，帮助读者更好地理解和实现MPC控制。同时，推荐观看UP主‘阿Xin自动驾驶’的相关视频，以便直观了解仿真效果。

基于ssm的校园二手交易平台管理系统(源码+数据库)162: 基于ssm的校园二手交易平台管理系统：前端 jsp、jquery，后端 maven、springmvc、spring、mybatis；角色分为管理员、用户；集成商品浏览、商品详情、在线购买、订单查询等功能于一体的系统。 ## 功能介绍 ### 管理员 - 物品分类管理：分类信息的增删改查，一级分类，二级分类 - 物品管理：用户发布的二手商品信息，后台管理员可以查看，删除商品，上架和下架操作 - 订单管理：用户在线购买商品后，管理员可以查询订单信息，订单删除，订单状态 - 用户管理：用户在前台自行注册的用户账号信息，管理员可以删除、禁用、激活 ### 用户 - 基本功能：登录，注册，退出 - 网站首页：全局搜索，分类导航，商品列表展示 - 商品：商品详情，商品收藏，联系卖家，物品留言，在线购买 - 发布商品：用户可以将自己闲置的二手商品发布到平台上进行售卖 - 我的：用户信息查看与修改，修改头像，密码修改，我收藏的物品，我发布的物品，我的订单 ## 环境 - IntelliJ IDEA 2021.3 - Mysql 5.7.26 - Tomcat 7.0.73 - JDK 1.8

工业控制领域200PLC实现两台水泵一用一备自动控制及故障切换: 内容概要：本文详细介绍了基于西门子S7-200 PLC的两台水泵一用一备自动控制系统的设计与实现。主要内容包括：1. 控制要求拆解，如总启动和总停止、一用一备交替工作、故障切换与报警、故障判断逻辑；2. 代码实现，涉及变量定义、总启动与总停止逻辑、电机交替运行逻辑、故障切换与报警逻辑；3. 上位机组态源程序，使用WinCC flexible进行画面设计和运行测试。通过这些内容，构建了一个能够稳定运行、具备故障自恢复能力的水泵控制系统。适合人群：从事工业自动化领域的工程师和技术人员，尤其是熟悉PLC编程和上位机组态的从业者。使用场景及目标：适用于需要高可靠性和冗余备份的工业水泵控制系统，旨在提高系统的稳定性和安全性，减少设备损耗，延长使用寿命。目标是在工业环境中实现无人值守的自动化控制。其他说明：文中提供了详细的编程思路和具体代码片段，帮助读者更好地理解和应用。此外，还提到了实际调试中遇到的问题及其解决方案，为实际工程应用提供宝贵的经验。

燃料电池汽车功率跟随Cruise-Matlab联合仿真模型及其优化策略: 内容概要：本文详细介绍了基于Cruise2019和Matlab2018a构建的燃料电池汽车功率跟随仿真模型。该模型通过多个控制模块确保燃料电池输出功率紧密跟随车辆需求，同时保持电池SOC稳定。具体包括：DCDC控制模块采用动态电压补偿策略，避免电压震荡；再生制动模块在高SOC时增加回收力度，减少机械制动磨损；机械制动与再生制动的无缝切换策略；以及针对燃料堆响应延迟的加速补偿措施。此外，文中还分享了多项调试经验和优化技巧，如变步长求解器的选择、虚拟CAN信号采集点的应用等。适合人群：从事新能源汽车研究的技术人员、高校相关专业师生、对燃料电池汽车感兴趣的科研工作者。使用场景及目标：适用于燃料电池汽车的动力系统仿真研究，旨在提高仿真精度，优化控制策略，缩短开发周期。其他说明：文中提供的代码片段和调试经验对于理解和改进燃料电池汽车的功率跟随性能具有重要参考价值。

基于ssm+vue的校园购物网站管理系统(源码+数据库)184: 基于ssm+vue的校园购物网站管理系统：前端 vue、elementui，后端 maven、springmvc、spring、mybatis；角色分为管理员、用户；集成商品浏览、购物车、在线结算、订单查询等功能于一体的系统。 ## 功能介绍 ### 用户 - 基本功能：登录，注册，退出 - 网站首页：主导航栏，轮播图，商品搜索，商品信息推荐，商品资讯 - 商品购买：商品列表展示，按商品名称和品牌模糊搜索商品，商品详情，购物车，积分兑换，在线结算 - 其他功能：商品资讯，留言反馈 - 个人中心：个人信息查询与修改，密码修改，我的订单查询，我的地址维护，我的收藏列表，用户充值 ### 管理员 - 用户管理：用户信息的增删改查，用户可以在用户端自行注册 - 商家管理：商家信息的增删改查 - 商品分类管理：分类信息的增删改查 - 商品信息管理：商品信息的增删改查，商品图片上传 - 订单评价管理：订单评价信息的列表查询，删除 - 留言板管理：用户在用户端发布的留言信息，管理员后台查看与回复 - 系统管理：轮播图信息的增删改查，商品资讯的增删改查 - 订单管理：订单的列表查询，发货操作 ## 环境 - IntelliJ IDEA 2021.3 - Mysql 5.7.26 - Tomcat 7.0.73 - Node 14.14.0 - JDK 1.8

最近访客 更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论