Linux 拨号vps windows公众号手机端

Spark中的DataFrame和Dataset有何区别

lewis 6年前 (2020-01-19) 阅读数 14 #网络运维
文章标签 spark

Spark中的DataFrame是一种分布式数据集,它是以表格的形式组织的数据集合,类似于关系型数据库中的表。DataFrame提供了一组丰富的API,可以用于对数据进行操作和转换。

而Dataset是Spark中引入的一种新的数据结构,它是一种类型安全的数据集合,可以存储不同类型的数据。Dataset既可以看作是一种强类型的DataFrame,也可以看作是一种分布式的数据集。

因此,DataFrame是一种类似于表格的数据集合,而Dataset是一种更加通用和类型安全的数据集合。在Spark中,通常建议使用Dataset来代替DataFrame,因为Dataset具有更好的类型安全性和更丰富的API。

版权声明

本文仅代表作者观点,不代表米安网络立场。

发表评论:

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。

热门