定 价:¥59.00
作 者: | (美)茱莉亚·斯拉格 |
出版社: | 机械工业出版社 |
丛编项: | |
标 签: | 程序设计 计算机/网络 |
ISBN: | 9787111588559 | 出版时间: | 2018-04-01 | 包装: | 平装-胶订 |
开本: | 16开 | 页数: | 字数: |
前言
第1章 整洁文本格式
比较整洁文本结构与其他数据结构
unnest_tokens函数
整理Jane Austen的作品
gutenbergr包
词频
总结
第2章 基于整洁数据的情感分析
情感数据集
内连接的情感分析
比较三个情感词典
最常见的正面单词和负面单词
Wordclouds模块
除单词外的其他文本单元
总结
第3章 分析词和文件频率:tf-idf
Jane Austen小说中的词项频率
Zipf定律
bind_tf_idf函数
物理学语料库
总结
第4章 词之间的关系:n-gram及相关性
n-gram词条化
用widyr包对单词对计数并计算相关性
总结
第5章 非整洁格式转换
使文档-词项矩阵整洁
将整洁文本数据转换为矩阵
总结
第6章 主题建模
LDA
示例:博大的图书馆馆藏
LDA方法的替代实现
总结
第7章 案例研究:Twitter归档文件比较
单词使用情况的比较
单词使用情况的变化
收藏和转发
总结
第8章 案例研究:NASA元数据挖掘
NASA如何组织数据
共现单词与相关单词
计算描述字段的tf-idf
总结
第9章 案例研究:分析Usenet文本
预处理
新闻组中的单词
情感分析
总结
参考文献