- 浏览: 109735 次
- 性别:
- 来自: 北京
-
最新评论
-
oaklet:
最新改进型
# coding:gbk
import sys
...
密码生成小工具 -
西斧头帮老大-_-:
楼主,那个我写了个例子
Map<String,Strin ...
EHCache简单使用 -
hopana:
发一下源代码吧,想学习一下
EHCache简单使用 -
menghuannvxia:
谢谢,学习了
EHCache简单使用 -
wtaisi:
非常好。。。。
EHCache简单使用
环境如下:
python-2.5.2
工作中经常遇到类似csv格式的文件文件,
为了处理起来方便,一般要导入到数据库中
MYSQL导入工具代码:
使用方法如下:
CSVloader -h
CSVloader -f bsc.csv bts.csv
CSVloader -d dir1 dir2
CSVloader -f bsc.csv bts.csv -s ,
CSVloader -d dir1 dir2 -s ,
CSVloader -s , -f bsc.csv bts.csv
CSVloader -s , -d dir1 dir2
Options include:
-h [help] - 打印帮助
-s [separtor] - 使用的分割符,默认 tab
-f [fileName] - 文件名,可以指定多个
-d [dirName] - 文件夹,可以指定多个
注意:文件必须是 UTF-8 编码
顺便写了个bat文件:
CSVloader.bat
(WinXP SP2,MySQL 5.0下使用通过,MySQL数据库使用UTF8编码,csv文件使用UTF8编码)
测试文本:A_OBJECT.txt
Oracle导入工具:
(WinXP SP2,Oracle 11下使用通过,Oracle数据库使用GBK编码,csv文件使用GBK编码)
注意一下,小工具拿到文件后,
会以文件名作为表名,开始造表(create),
字段全部为字符串,各个字段长度会根据
第一批读入的数据进行计算(第一批读1M,可以调,防大文件用的),
还要注意一下
MySQL版本与Oracle版本有点区别,
MySQL版本有自动删除表功能,先试着删除一遍,才会建表,导入数据;
Oracle版本没有加删除表功能,只有建表导入数据过程。
(MySQL一般只在自己本本上使用,所以导入,改改文件再导入方便,无需去手动删除表,
Oracle一般会在服务器上导数据用,怕删掉不该删除的东西,所以未加这个功能)
再有MySQL版用UTF8编码,Oracle版用的GBK编码,这个跟数据库的设置有关
UTF8编码与GBK编码转换,可参考使用文本学习笔记3的批量转换工具
当然,文件不多也可以用文本编辑器手动另存转换。
贾
卢
惨
御
雏
皿
陨
褶
苷
嫌
盯
铡
python-2.5.2
工作中经常遇到类似csv格式的文件文件,
为了处理起来方便,一般要导入到数据库中
MYSQL导入工具代码:
# coding:UTF-8 import os import sys import time import MySQLdb perread = 1048576 # 1M original = 32 size_list = [] for i in range(125): size_list.append(original) original = original + 32 def getSize(aName, aSize): for i in size_list: if aSize<i: return i raise ValueError("字段太长 '%s' %s"%(aName, aSize)) def loadCSV(fileName, separtor=" "): print "loadCSV", fileName, "..." tf = file(fileName, "r") connMys = MySQLdb.connect(host="127.0.0.1", user="root", passwd="pass", db="test", charset="UTF8") begin = time.time() mark = 0 count = 0 currLines = tf.readlines(perread) count = count + len(currLines) - 1 currTable = [i.rstrip().split(separtor) for i in currLines if len(i.rstrip())>0] columnName = currTable[0] for i in columnName: if not i: raise ValueError("字段名不能为空!") columnCount = len(columnName) currTable = fillSpace(currTable, columnCount) currTable = distinctColumn(currTable) aName = os.path.split(fileName)[1].split(".")[0] dropSQL, createSQL, insertSQL = buildCreate(aName, currTable) cursorMys = connMys.cursor() print dropSQL, ";" cursorMys.execute(dropSQL) print createSQL, ";" cursorMys.execute(createSQL) connMys.commit() print insertSQL, ";" for i in currTable[1:]: cursorMys.execute(insertSQL, i) connMys.commit() print "insert", count, "lines." while tf.tell() > mark: mark = tf.tell() currLines = tf.readlines(perread) if not tf.tell() > mark: break count = count + len(currLines) currTable = [i.rstrip().split(separtor) for i in currLines if len(i.rstrip())>0] currTable = fillSpace(currTable, columnCount) for i in currTable: cursorMys.execute(insertSQL, i) connMys.commit() print "insert", count, "lines." end = time.time() print "Count:%s Time:%s"%(count, end - begin) cursorMys.close() connMys.close() tf.close() def fillSpace(aTable, colCount): for ii, iv in enumerate(aTable): while len(iv) < colCount: iv.append("") if len(iv) != colCount: raise ValueError("字段不够多!" + str(iv)) return aTable def distinctColumn(aTable): columnNames = aTable[0] ucolumnNames = set(columnNames) if len(columnNames)==len(ucolumnNames): return aTable tcinclude = [] tcexclude = [] for i, v in enumerate(columnNames): if v in tcinclude: print "字段竟然重复", v tcexclude.append(i) else: tcinclude.append(v) result = [] for i in aTable: result.append([v for j, v in enumerate(i) if j not in tcexclude]) return result def buildCreate(aName, aTable): columnNames = aTable[0] columnSizes = [getSize(k, len(v)) for k, v in zip(aTable[0], aTable[1])] for i in aTable[2:]: for j, v in enumerate(i): if not len(v)<columnSizes[j]: columnSizes[j] = getSize(columnNames[j], len(v)) dropSQL = "DROP TABLE IF EXISTS " + aName createSQL = ["CREATE TABLE IF NOT EXISTS " + aName] createSQL.append("(") for k, v in zip(columnNames, columnSizes): currLines = " %s VARCHAR(%s),"%(k, v) createSQL.append(currLines) createSQL[-1] = " %s VARCHAR(%s)"%(k, v) createSQL.append(")") k = ", ".join(columnNames) v = ", ".join(["%s" for i in range(len(columnNames))]) insertSQL = "INSERT INTO %s (%s) VALUES (%s)"%(aName, k, v) return (dropSQL, "\n".join(createSQL), insertSQL) def usage(): print "CSVloader -h" print "CSVloader -f bsc.csv bts.csv" print "CSVloader -d dir1 dir2" print "CSVloader -f bsc.csv bts.csv -s ," print "CSVloader -d dir1 dir2 -s ," print "CSVloader -s , -f bsc.csv bts.csv" print "CSVloader -s , -d dir1 dir2" print " Options include:" print " -h [help] - 打印帮助" print " -s [separtor] - 使用的分割符,默认 tab" print " -f [fileName] - 文件名,可以指定多个" print " -d [dirName] - 文件夹,可以指定多个" print print " 注意:文件必须是 UTF-8 编码" if __name__ == "__main__": if "-h" in sys.argv: usage() elif "-d" in sys.argv: separtor = " " idxf = sys.argv.index("-d") if "-s" in sys.argv: idxs = sys.argv.index("-s") separtor = sys.argv[idxs+1] if idxs>idxf: for i in sys.argv[idxf+1:idxs]: for j in os.listdir(i): loadCSV(os.path.join(i, j), separtor) else: for i in sys.argv[idxf+1:]: for j in os.listdir(i): loadCSV(os.path.join(i, j), separtor) else: for i in sys.argv[idxf+1:]: for j in os.listdir(i): loadCSV(os.path.join(i, j), separtor) elif "-f" in sys.argv: separtor = " " idxf = sys.argv.index("-f") if "-s" in sys.argv: idxs = sys.argv.index("-s") separtor = sys.argv[idxs+1] if idxs>idxf: for i in sys.argv[idxf+1:idxs]: loadCSV(i, separtor) else: for i in sys.argv[idxf+1:]: loadCSV(i, separtor) else: for i in sys.argv[idxf+1:]: loadCSV(i, separtor) else: usage()
使用方法如下:
CSVloader -h
CSVloader -f bsc.csv bts.csv
CSVloader -d dir1 dir2
CSVloader -f bsc.csv bts.csv -s ,
CSVloader -d dir1 dir2 -s ,
CSVloader -s , -f bsc.csv bts.csv
CSVloader -s , -d dir1 dir2
Options include:
-h [help] - 打印帮助
-s [separtor] - 使用的分割符,默认 tab
-f [fileName] - 文件名,可以指定多个
-d [dirName] - 文件夹,可以指定多个
注意:文件必须是 UTF-8 编码
顺便写了个bat文件:
CSVloader.bat
@echo off python CSVloader.py %*
(WinXP SP2,MySQL 5.0下使用通过,MySQL数据库使用UTF8编码,csv文件使用UTF8编码)
测试文本:A_OBJECT.txt
oid,city,type,pid 7,邢台市,103,7 8,廊坊市,103,8 1,沧州市,103,1 3,高邑县,104,4 4,河间市,104,1 2,赵县,104,4
Oracle导入工具:
# coding:GBK import os import sys import time import cx_Oracle perread = 1048576 # 1M # original = 64 # size_list = [] # while original<4000: # size_list.append(original) # original = original*2 original = 32 size_list = [] for i in range(125): size_list.append(original) original = original + 32 def getSize(aName, aSize): for i in size_list: if aSize<i: return i raise ValueError("字段太长 '%s' %s"%(aName, aSize)) def loadCSV(fileName, separtor=" "): print "loadCSV", fileName, "..." tf = file(fileName, "r") connOra = cx_Oracle.connect("user", "pass", "192.168.1.110:1521/testdb") begin = time.time() mark = 0 count = 0 currLines = tf.readlines(perread) count = count + len(currLines) - 1 currTable = [i.rstrip().split(separtor) for i in currLines if len(i.rstrip())>0] columnName = currTable[0] for i in columnName: if not i: raise ValueError("字段名不能为空!") columnCount = len(columnName) currTable = fillSpace(currTable, columnCount) currTable = distinctColumn(currTable) aName = os.path.split(fileName)[1].split(".")[0] createSQL, insertSQL = buildCreate(aName, currTable) cursorOra = connOra.cursor() print createSQL, ";" cursorOra.execute(createSQL) connOra.commit() print insertSQL, ";" cursorOra.prepare(insertSQL) cursorOra.executemany(None, currTable[1:]) connOra.commit() print "insert", count, "lines." while tf.tell() > mark: mark = tf.tell() currLines = tf.readlines(perread) if not tf.tell() > mark: break count = count + len(currLines) currTable = [i.rstrip().split(separtor) for i in currLines if len(i.rstrip())>0] currTable = fillSpace(currTable, columnCount) cursorOra.executemany(None, currTable) connOra.commit() print "insert", count, "lines." end = time.time() print "Count:%s Time:%s"%(count, end - begin) cursorOra.close() connOra.close() tf.close() def fillSpace(aTable, colCount): for ii, iv in enumerate(aTable): while len(iv) < colCount: iv.append("") if len(iv) != colCount: raise ValueError("字段不够多!" + str(iv)) return aTable def distinctColumn(aTable): columnNames = aTable[0] ucolumnNames = set(columnNames) if len(columnNames)==len(ucolumnNames): return aTable tcinclude = [] tcexclude = [] for i, v in enumerate(columnNames): if v in tcinclude: print "字段竟然重复", v tcexclude.append(i) else: tcinclude.append(v) result = [] for i in aTable: result.append([v for j, v in enumerate(i) if j not in tcexclude]) return result def buildCreate(aName, aTable): columnNames = aTable[0] columnSizes = [getSize(k, len(v)) for k, v in zip(aTable[0], aTable[1])] for i in aTable[2:]: for j, v in enumerate(i): if not len(v)<columnSizes[j]: columnSizes[j] = getSize(columnNames[j], len(v)) createSQL = ["CREATE TABLE " + aName] createSQL.append("(") for k, v in zip(columnNames, columnSizes): currLines = " %s VARCHAR2(%s),"%(k, v) createSQL.append(currLines) createSQL[-1] = " %s VARCHAR2(%s)"%(k, v) createSQL.append(")") k = ", ".join(columnNames) v = ", ".join([":%s"%(i+1) for i in range(len(columnNames))]) insertSQL = "INSERT INTO %s (%s) VALUES (%s)"%(aName, k, v) return ("\n".join(createSQL), insertSQL) def usage(): print "CSVloader -h" print "CSVloader -f bsc.csv bts.csv" print "CSVloader -d dir1 dir2" print "CSVloader -f bsc.csv bts.csv -s ," print "CSVloader -d dir1 dir2 -s ," print "CSVloader -s , -f bsc.csv bts.csv" print "CSVloader -s , -d dir1 dir2" print " Options include:" print " -h [help] - 打印帮助" print " -s [separtor] - 使用的分割符,默认 tab" print " -f [fileName] - 文件名,可以指定多个" print " -d [dirName] - 文件夹,可以指定多个" print print " 注意:文件必须是 GBK 编码" if __name__ == "__main__": if "-h" in sys.argv: usage() elif "-d" in sys.argv: separtor = " " idxf = sys.argv.index("-d") if "-s" in sys.argv: idxs = sys.argv.index("-s") separtor = sys.argv[idxs+1] if idxs>idxf: for i in sys.argv[idxf+1:idxs]: for j in os.listdir(i): loadCSV(os.path.join(i, j), separtor) else: for i in sys.argv[idxf+1:]: for j in os.listdir(i): loadCSV(os.path.join(i, j), separtor) else: for i in sys.argv[idxf+1:]: for j in os.listdir(i): loadCSV(os.path.join(i, j), separtor) elif "-f" in sys.argv: separtor = " " idxf = sys.argv.index("-f") if "-s" in sys.argv: idxs = sys.argv.index("-s") separtor = sys.argv[idxs+1] if idxs>idxf: for i in sys.argv[idxf+1:idxs]: loadCSV(i, separtor) else: for i in sys.argv[idxf+1:]: loadCSV(i, separtor) else: for i in sys.argv[idxf+1:]: loadCSV(i, separtor) else: usage()
(WinXP SP2,Oracle 11下使用通过,Oracle数据库使用GBK编码,csv文件使用GBK编码)
注意一下,小工具拿到文件后,
会以文件名作为表名,开始造表(create),
字段全部为字符串,各个字段长度会根据
第一批读入的数据进行计算(第一批读1M,可以调,防大文件用的),
还要注意一下
MySQL版本与Oracle版本有点区别,
MySQL版本有自动删除表功能,先试着删除一遍,才会建表,导入数据;
Oracle版本没有加删除表功能,只有建表导入数据过程。
(MySQL一般只在自己本本上使用,所以导入,改改文件再导入方便,无需去手动删除表,
Oracle一般会在服务器上导数据用,怕删掉不该删除的东西,所以未加这个功能)
再有MySQL版用UTF8编码,Oracle版用的GBK编码,这个跟数据库的设置有关
UTF8编码与GBK编码转换,可参考使用文本学习笔记3的批量转换工具
当然,文件不多也可以用文本编辑器手动另存转换。
贾
卢
惨
御
雏
皿
陨
褶
苷
嫌
盯
铡
发表评论
-
密码生成小工具
2011-12-27 09:57 2312CSDN数据库.zip 天涯数据库.zip 金山毒霸.zip ... -
文本处理学习笔记4
2010-09-07 17:18 1203环境情况如下: python-2.5.2 Python在文 ... -
文本处理学习笔记3
2010-06-17 13:48 1678环境情况如下: python-2.5.2 pytho ... -
文本处理学习笔记2
2010-01-29 16:04 1478环境情况如下: python-2.5.2 Python在文 ... -
Oracle入库速度测试(Python版)
2008-08-26 19:09 3023测试环境: Intel Xeon 2.4G四核心 2. ... -
文本处理学习笔记1
2008-02-26 12:24 1483环境情况如下: python-2.5.2 ibatis-2.3 ...
相关推荐
在日常的开发和使用中,我们经常需要借助各种小工具来提高工作效率,例如快速启动常用的应用程序、管理文件等。一个简单但功能强大的集成工具箱可以帮助用户快速访问、启动并管理程序。今天,我们将以Python为基础,结合Tkinter和Win32API,开发一个类似Windows快捷方式的工具箱应用,能够让你轻松集成各种常用程序并一键启动
django自建博客app
《基于YOLOv8的智慧校园实验室高压灭菌锅安全联锁系统》(包含源码、可视化界面、完整数据集、部署教程)简单部署即可运行。功能完善、操作简单,适合毕设或课程设计
用于hifi测序数据的基因组组装程序
Microsoft Access 2010 数据库引擎可再发行程序包AccessDatabaseEngine-X64解压后的文件AceRedist
从大模型、智能体到复杂AI应用系统的构建——以产业大脑为例
自然语言处理之TF-IDF算法与TextRank算法的缠绵_textrank,tf-idf和两者的组合-CSDN博客.html
内容概要:2023版《科学智能 (AI4S)全球发展观察与展望》阐述了AI for Science(AI4S)在全球范围内的最新进展及其对科学和工业的深远影响。文章首先回顾了AI4S在过去一年中的快速发展,特别是在药物研发、材料科学、地质学、污染治理等多个领域的应用实例。AI4S通过结合深度学习、机器学习和其他AI技术,加速了从基础研究到实际应用的转化过程。例如,在药物研发中,AI4S帮助科学家克服了“反摩尔定律”的挑战,提高了新药研发的成功率;在材料科学中,AI4S实现了复杂材料的高效模拟,如人造钻石、石墨烯、碳纳米管等;在地质学中,AI4S通过模拟地球内部结构和物理过程,为地震学研究提供了新视角。此外,文章还探讨了大语言模型(LLMs)与科学方法的结合,指出LLMs不仅能辅助科学研究,还能生成新的科学假设并进行逻辑推理。 适合人群:具备一定科研背景或对AI技术感兴趣的科研人员、工程师、政策制定者及高校师生。
这个数据集包含了日常步数统计、睡眠时长、活跃分钟数以及消耗的卡路里,是个人健康与健身追踪的一部分。 该数据集非常适合用于以下实践: 数据清洗:现实世界中的数据往往包含缺失值、异常值或不一致之处。例如,某些天的步数可能缺失,或者存在不切实际的数值(如10,000小时的睡眠或负数的卡路里消耗)。通过处理这些问题,可以学习如何清理和准备数据进行分析。 探索性分析(发现日常习惯中的模式):可以通过分析找出日常生活中的模式和趋势,比如一周中哪一天人们通常走得最多,或是睡眠时间与活跃程度之间的关系等。 构建可视化图表(步数趋势、睡眠与活动对比图):将数据转换成易于理解的图形形式,有助于更直观地看出数据的趋势和关联。例如,绘制步数随时间变化的趋势图,或是比较睡眠时间和活动量之间的关系图。 数据叙事(将个人风格的追踪转化为可操作的见解):通过讲述故事的方式,把从数据中得到的洞察变成具体的行动建议。例如,根据某人特定时间段内的活动水平和睡眠质量,提供改善健康状况的具体建议。
框架结构天城商业办公楼5200平米(建筑图 结构图 计算书 开题报告 任务书 文献翻.zip
柴油机连杆加工工艺及夹具设计.zip
读书网首页的HTML信息
文字渐变颜色代码生成器:让文字绽放多彩魅力,演示:在信息交流日益丰富的今天,个性化的文字展示成为吸引目光的关键。这款文字渐变颜色代码生成器,便是为满足这一需求而生的绿色软件,无需安装,便捷实用。 它的操作极为简便。用户只需在软件界面中输入想要转换的文字内容,接着从丰富的色彩选项里挑选心仪的起始颜色与结束颜色,随后轻轻按下 “转换按钮”,神奇的事情就此发生 —— 适用于论坛、网页、QQ 空间等多种平台,以及自定义格式的渐变颜色代码便会即刻生成。不仅如此,生成的代码还能自动复制到剪切板,极大地节省了用户手动复制的时间。当你在论坛回帖、更新网页内容或是装扮 QQ 空间时,只需轻松粘贴代码,原本单调的文字瞬间就能拥有绚丽的渐变色彩,瞬间脱颖而出,为你的表达增添独特魅力,让文字不再平凡,轻松成为视觉焦点。 一款可以轻松把一段文字生成渐变颜色代码的绿色软件,当你在软件中输入完要转换的文字后,只需要挑选自己喜欢的起始颜色、结束颜色后,按一下―转换按钮即可生成相应的论坛/网页/QQ空间以及自定义格式代码,并且代码可以自动复制到剪切板中,回帖时直接粘贴代码即可不错得文字代码生成器,让你得文字更加漂亮.
1.【锂电池剩余寿命预测】Transformer锂电池剩余寿命预测(Matlab完整源码和数据) 2.数据集:NASA数据集,已经处理好,B0005电池训练、B0006测试; 3.环境准备:Matlab2023b,可读性强; 4.模型描述:Transformer在各种各样的问题上表现非常出色,现在被广泛使用。 5.领域描述:近年来,随着锂离子电池的能量密度、功率密度逐渐提升,其安全性能与剩余使用寿命预测变得愈发重要。本代码实现了Transformer在该领域的应用。 6.作者介绍:机器学习之心,博客专家认证,机器学习领域创作者,2023博客之星TOP50,主做机器学习和深度学习时序、回归、分类、聚类和降维等程序设计和案例分析,文章底部有博主联系方式。从事Matlab、Python算法仿真工作8年,更多仿真源码、数据集定制私信。
资源内项目源码是来自个人的毕业设计,代码都测试ok,包含源码、数据集、可视化页面和部署说明,可产生核心指标曲线图、混淆矩阵、F1分数曲线、精确率-召回率曲线、验证集预测结果、标签分布图。都是运行成功后才上传资源,毕设答辩评审绝对信服的保底85分以上,放心下载使用,拿来就能用。包含源码、数据集、可视化页面和部署说明一站式服务,拿来就能用的绝对好资源!!! 项目备注 1、该资源内项目代码都经过测试运行成功,功能ok的情况下才上传的,请放心下载使用! 2、本项目适合计算机相关专业(如计科、人工智能、通信工程、自动化、电子信息等)的在校学生、老师或者企业员工下载学习,也适合小白学习进阶,当然也可作为毕设项目、课程设计、大作业、项目初期立项演示等。 3、如果基础还行,也可在此代码基础上进行修改,以实现其他功能,也可用于毕设、课设、作业等。 下载后请首先打开README.txt文件,仅供学习参考, 切勿用于商业用途。
资源内项目源码是来自个人的毕业设计,代码都测试ok,包含源码、数据集、可视化页面和部署说明,可产生核心指标曲线图、混淆矩阵、F1分数曲线、精确率-召回率曲线、验证集预测结果、标签分布图。都是运行成功后才上传资源,毕设答辩评审绝对信服的保底85分以上,放心下载使用,拿来就能用。包含源码、数据集、可视化页面和部署说明一站式服务,拿来就能用的绝对好资源!!! 项目备注 1、该资源内项目代码都经过测试运行成功,功能ok的情况下才上传的,请放心下载使用! 2、本项目适合计算机相关专业(如计科、人工智能、通信工程、自动化、电子信息等)的在校学生、老师或者企业员工下载学习,也适合小白学习进阶,当然也可作为毕设项目、课程设计、大作业、项目初期立项演示等。 3、如果基础还行,也可在此代码基础上进行修改,以实现其他功能,也可用于毕设、课设、作业等。 下载后请首先打开README.txt文件,仅供学习参考, 切勿用于商业用途。
Android项目原生java语言课程设计,包含LW+ppt
配套文章:https://blog.csdn.net/gust2013/article/details/146909670?spm=1001.2014.3001.5502
《基于YOLOv8的智慧社区儿童游乐设施安全监测系统》(包含源码、可视化界面、完整数据集、部署教程)简单部署即可运行。功能完善、操作简单,适合毕设或课程设计