科技: 人物 企业 技术 IT业 TMT
科普: 自然 科学 科幻 宇宙 科学家
通信: 历史 技术 手机 词典 3G馆
索引: 分类 推荐 专题 热点 排行榜
互联网: 广告 营销 政务 游戏 google
新媒体: 社交 博客 学者 人物 传播学
新思想: 网站 新书 新知 新词 思想家
图书馆: 文化 商业 管理 经济 期刊
网络文化: 社会 红人 黑客 治理 亚文化
创业百科: VC 词典 指南 案例 创业史
前沿科技: 清洁 绿色 纳米 生物 环保
知识产权: 盗版 共享 学人 法规 著作
用户名: 密码: 注册 忘记密码?
    创建新词条
科技百科
  • 人气指数: 3318 次
  • 编辑次数: 1 次 历史版本
  • 更新时间: 2009-03-18
admin
admin
发短消息
相关词条
bat
bat
Processing语言
Processing语言
固件
固件
SSID
SSID
LAMP
LAMP
Flash和HTML5
Flash和HTML5
沙盒
沙盒
六种主要计算机语言优缺点
六种主要计算机语言优缺点
系统集成
系统集成
间谍软件
间谍软件
推荐词条
希拉里二度竞选
希拉里二度竞选
《互联网百科系列》
《互联网百科系列》
《黑客百科》
《黑客百科》
《网络舆情百科》
《网络舆情百科》
《网络治理百科》
《网络治理百科》
《硅谷百科》
《硅谷百科》
2017年特斯拉
2017年特斯拉
MIT黑客全纪录
MIT黑客全纪录
桑达尔·皮查伊
桑达尔·皮查伊
阿里双十一成交额
阿里双十一成交额
最新词条

热门标签

微博侠 数字营销2011年度总结 政务微博元年 2011微博十大事件 美国十大创业孵化器 盘点美国导师型创业孵化器 盘点导师型创业孵化器 TechStars 智能电视大战前夜 竞争型国企 公益型国企 2011央视经济年度人物 Rhianna Pratchett 莱恩娜·普莱契 Zynga与Facebook关系 Zynga盈利危机 2010年手机社交游戏行业分析报告 游戏奖励 主流手机游戏公司运营表现 主流手机游戏公司运营对比数据 创建游戏原型 正反馈现象 易用性设计增强游戏体验 易用性设计 《The Sims Social》社交亮 心理生理学与游戏 Kixeye Storm8 Storm8公司 女性玩家营销策略 休闲游戏的创新性 游戏运营的数据分析 社交游戏分析学常见术语 游戏运营数据解析 iPad风行美国校园 iPad终结传统教科书 游戏平衡性 成长类型及情感元素 鸿蒙国际 云骗钱 2011年政务微博报告 《2011年政务微博报告》 方正产业图谱 方正改制考 通信企业属公益型国企 善用玩家作弊行为 手机游戏传播 每用户平均收入 ARPU值 ARPU 游戏授权三面观 游戏设计所运用的化学原理 iOS应用人性化界面设计原则 硬核游戏 硬核社交游戏 生物测量法研究玩家 全球移动用户 用户研究三部曲 Tagged转型故事 Tagged Instagram火爆的3大原因 全球第四大社交网络Badoo Badoo 2011年最迅猛的20大创业公司 病毒式传播功能支持的游戏设计 病毒式传播功能 美国社交游戏虚拟商品收益 Flipboard改变阅读 盘点10大最难iPhone游戏 移动应用设计7大主流趋势 成功的设计文件十个要点 游戏设计文件 应用内置付费功能 内置付费功能 IAP功能 IAP IAP模式 游戏易用性测试 生理心理游戏评估 游戏化游戏 全美社交游戏规模 美国社交游戏市场 全球平板电脑出货量 Facebook虚拟商品收益 Facebook全球广告营收 Facebook广告营收 失败游戏设计的数宗罪名 休闲游戏设计要点 玩游戏可提高认知能力 玩游戏与认知能力 全球游戏广告 独立开发者提高工作效率的100个要点 Facebook亚洲用户 免费游戏的10种创收模式 人类大脑可下载 2012年最值得期待的20位硅谷企业家 做空中概股的幕后黑手 做空中概股幕后黑手 苹果2013营收 Playfish社交游戏架构

中科永联高级技术培训中心(www.itisedu.com

  原始数据(也被称为source data源数据或者atomic data原子数据)。通常认为数据与信息的区别在于:信息是经过加工处理之后的数据,而数据则是未经加工的数据。按照这种标准,数据也就是原始数据。

  并不是所有的原始数据都能成为信息,数据成为信息还要经过筛选、组织然后按照一定的格式进行整理才能成为信息。比如,超市里的POS机每天都会收集到大量的原始数据,但是,如果不经过处理,这些数据并不能产生什么信息。经过处理之后的超市数据可以显示出很多情况,比如客户喜欢购买什么东西,客户通常逛超市的时间以及他们购买物品的价格范围等等,这就是信息。这种信息可以用于预测技术,进而制定商业计划,最终赢得市场。

  经过处理之后,原始数据会生成一个数据库,数据库中的信息可以用来进一步的处理,经过分析之后,可以用于多种用途。

源数据抽取优化的问题

运行完session后,查看log,发现源数据读取的吞吐量仅为几百条左右,察看详细的session log发现,整个etl过程瓶颈在于源数据的读取,
如果在TOAD中直接运行数据源的sql查询发回所有记录只需4秒钟左右,这是怎么回事?可不可以优化?

SESSION LOG:
***** RUN INFO FOR TGT LOAD ORDER GROUP 【2】, SRC PIPELINE 【1】 *****
MASTER> PETL_24018 Thread 【READER_2_1_1】 created for the read stage of partition point 【SQ_BOM】 has completed: Total Run Time = 【195.091525】 secs, Total Idle Time = 【0.000000】 secs, Busy Percentage = 【100.000000】.

MASTER> PETL_24019 Thread 【TRANSF_2_1_1_1】 created for the transformation stage of partition point 【SQ_BOM】 has completed: Total Run Time = 【193.616721】 secs, Total Idle Time = 【180.455230】 secs, Busy Percentage = 【6.797704】.

MASTER> PETL_24022 Thread 【WRITER_2_1_1】 created for the write stage of partition point(s) 【BOM】 has completed: Total Run Time = 【135.793892】 secs, Total Idle Time = 【135.682443】 secs, Busy Percentage = 【0.082072】.

→如果您认为本词条还有待完善,请 编辑词条

词条内容仅供参考,如果您需要解决具体问题
(尤其在法律、医学等领域),建议您咨询相关领域专业人士。
0

标签: 原始数据

收藏到: Favorites  

同义词: 暂无同义词

关于本词条的评论 (共0条)发表评论>>

对词条发表评论

评论长度最大为200个字符。