1. 数据挖掘1.1. 指设计特定算法从大量的数据集中去探索发现知识或者模式的理论和方法是知识工程学科中知识发现的关键步骤1.2. 直观的定义是通过自动或半自动的方法探索与分析数据从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、潜在有用的信息和知识的过程1.3. 数据挖掘不是数据查询或网页搜索它融合了统计、数据库、人工智能、模式识别和机器学习理论中的思路特别关注异常数据、高维数据、异构和异地数据的处理等挑战性问题1.4. 任务1.4.1. 基于某些变量预测其他变量的未来值即预测性方法例如分类、回归1.4.2. 以人类可解释的模式描述数据如聚类、模式挖掘、关联规则发现1.5. 数据挖掘指从大量数据中识别有效的、新颖的、潜在有用的、最终可理解的规律和知识1.6. 主要方法1.6.1. 描述性方法1.6.1.1. 聚类1.6.1.1.1. 位于同一类的数据点彼此之间的相似度大于与其他类的数据点的相似度1.6.1.1.2. 在划分对象时不仅要考虑对象之间的距离还要求划分出的类具有某种内涵描述从而避免传统技术的某些片面性1.6.1.2. 概念描述1.6.1.2.1. 指对某类数据对象的内涵进行描述并概括这类对象的有关特征1.6.1.2.2. 特征性描述1.6.1.2.2.1. 描述某类对象的*共同特征1.6.1.2.3. 区别性描述1.6.1.2.3.1. 描述不同类对象之间的*区别1.6.1.3. 关联规则挖掘1.6.1.3.1. 关联规则描述在一个数据集中一个数据与其他数据之间的相互依存性和关联性1.6.1.3.2. 数据关联是数据库中存在的一类重要的可被发现的知识1.6.1.3.3. 若两个或多个变量的属性值之间存在某种规律性就称为关联1.6.1.3.4. 关联可分为简单关联、时序关联、因果关联1.6.1.3.5. 关联规则挖掘则是从事务、关系数据中的项集合对象中发现频繁模式、关联规则、相关性或因果结构1.6.1.4. 序列模式挖掘1.6.1.4.1. 针对具有时间或顺序上的关联性的时序数据集序列模式挖掘就是挖掘相对时间或其他模式出现频率高的模式1.6.1.4.2. 主要针对符号模式而数字曲线模式属于统计时序分析中的趋势分析和预测范畴1.6.1.4.3. 时序模式是指通过时间序列搜索出的重复发生概率较高的模式1.6.2. 预测性方法1.6.2.1. 分类1.6.2.1.1. 分类算法需要从训练集中获得一个关于类别和其他属性值之间关系的模型继而在测试集上应用该模型确定模型的精度1.6.2.1.2. 一个待处理的数据集可分为训练集和测试集两个部分前者用于构建模型后者用于验证1.6.2.2. 回归1.6.2.2.1. 研究一个随机变量对另一组变量的相依关系的统计分析方法1.6.2.2.2. 线性回归是利用数理统计中的回归分析来确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法1.6.2.2.3. 当自变量为非随机变量、因变量为随机变量时分析它们的关系称为回归分析1.6.2.2.4. 当两者都是随机变量时称为相关分析1.6.2.3. 偏差检测1.6.2.3.1. 大型数据集中常有异常或离群值统称为偏差1.6.2.3.2. 偏差检验的基本方法就是寻找观察结果与参照值之间的差别2. 数据科学与可视化2.1. 数据工作流2.1.1. 工作流是多个用户之间按照某种预定义的规则传递文档、信息或任务的自动过程2.1.2. 工作流概念起源于生产组织和办公自动化领域用于描述一个特定的、实际的过程步骤在计算机应用环境下属于计算机支持的协同工作的研究范畴2.1.3. 定义和遵循工作流有助于以标准化、自动化的方式实现某个预期的业务目标便于协同、分享、发布和传播有效的工作模式2.1.4. 形式2.1.4.1. 面向商业流程处理和商业数据处理的商业工作流2.1.4.2. 面向科学研究过程控制和数据处理流程控制的科学工作流2.1.4.2.1. Taverna2.1.4.2.2. Kepler Project2.1.5. 数据工作流特指为数据处理和分析流程定义的自动过程其本质是计算业务过程的部分或整体在计算机应用环境下的自动化与自动化工程学科密切相关2.1.6. VisTrails*是一个开源的面向计算机仿真、数据浏览和可视化的科学工作流管理系统2.1.7. DimStiller2.1.8. 随着机器学习等领域的迅猛发展以机器学习和数据挖掘为主要数据分析方法的数据科学工作流系统也蓬勃兴起2.2. 可视数据挖掘2.2.1. 目的在于使用户能够参与对大规模数据集进行探索和分析的过程并在参与过程中搜索感兴趣的知识2.2.2. 可视化技术也被应用来呈现数据挖掘算法的输入数据和输出结果使数据挖掘模型的可解释性得以增强从而提高数据探索的效率2.2.3. 两大类2.2.3.1. 可视化增强的通用数据挖掘方法2.2.3.1.1. 以数据挖掘算法和模型为主并不针对具体的应用场景或数据类型2.2.3.1.2. 可视化作为辅助手段帮助更加直观地展示输入数据和计算结果或者直接深入模型内部使用户直接看到模型的核心数据和结构并进行交互式调整2.2.3.1.3. 基于黑盒方式的可视化增强方法2.2.3.1.3.1. 面向输入数据的可视化方法2.2.3.1.3.2. 面向算法结果的可视化方法2.2.3.1.3.2.1. 数据挖掘算法的输出结果是用户最关心的内容可视化方法通常用于结果分析、模型验证等方面2.2.3.1.3.3. 迭代式可视化方法2.2.3.1.4. 基于白盒方式的可视化增强方法2.2.3.2. 面向应用场景的方法2.2.3.2.1. 文本分析2.2.3.2.1.1. 数据挖掘及可视化方法在文本分析中占有非常重要的地位2.2.3.2.2. 图像分析2.2.3.2.2.1. 谱聚类方法*在图像分析中有着广泛的应用2.2.3.2.3. 用户行为分析2.2.3.2.3.1. 用户在同一网站上的页面浏览顺序形成点击流2.2.3.2.4. 时空数据分析2.2.3.2.4.1. 时空数据挖掘重点关注带有时间和空间属性的数据2.2.3.2.5. 深度学习2.2.3.2.5.1. 随着深度学习在各个领域的爆发式增长可视化研究者也开始着手利用自己所长对深度学习模型开展研究和探索2.2.3.2.5.2. 深度生成模型DGM,Deep Generative Model是近几年来深度学习方面最前沿的研究之一其训练过程相对于其他模型如CNN、RNN等来说较为复杂且十分依赖使用者对深度学习算法的深入理解和实践经验2.2.3.2.6. 其他应用场景2.2.3.2.6.1. 在高维数据分析方面INFUSE系统借助交互式可视化方法对特征选取任务进行辅助和增强2.2.3.2.6.2. 在回归分析方面HyperMoVal系统和文献均提出了新的可视化设计以展示回归分析中的数据分布和模型的训练结果3. 数据科学的挑战3.1. 作为数据获取和存储基础的计算机科学由于数据成本急剧下降导致的数据量急剧增长、数据复杂程度飞速上升如何有效地获取数据、有效地处理数据获取的不确定性、对原始数据进行清理、分析进而高效地完成数据存储和访问达到去重、去粗取精的目的是急需解决的问题3.2. 如何构建结构化数据与非结构化数据之间的有效关联及语义信息存储异构、多元数据之间的关系并支持后续分析并提供足够的性能保证也是面临的挑战之一3.3. 对于统计、分析、数据挖掘研究者将大数据变“小”即从大数据中获取更加有效的信息和知识是研究重点3.4. 可视化作为数据科学中不可或缺的重要一环也开始高度关注大数据带来的问题其中包括高维数据可视化复杂、异构数据可视化针对海量数据的实时交互设计分布式协同可视化以及针对大数据的可视分析流程等