news 2026/8/3 4:33:15

Pandas库基础概念和基础操作

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Pandas库基础概念和基础操作

Pandas 是 Python 中用于数据分析和处理最流行的开源库之一,建立在 NumPy 之上,提供了高性能、易用的数据结构和数据分析工具。它特别适合处理结构化数据(如表格型或异质型数据)。以下是 Pandas 的基础概念详细介绍:


一、核心数据结构

Pandas 主要有两个核心数据结构:

1.Series

  • 一维带标签的数组,可以保存任何数据类型(整数、字符串、浮点数、Python 对象等)。
  • 类似于带索引的 NumPy 数组。
  • 每个元素都有一个对应的标签(称为 index)。
importpandasaspd s=pd.Series([1,3,5,7],index=['a','b','c','d'])print(s)

输出:

a 1 b 3 c 5 d 7 dtype: int64

特点:

  • 自动对齐索引(在运算时非常有用)
  • 支持向量化操作
  • 可以看作是字典和数组的结合体

2.DataFrame

  • 二维表格型数据结构,类似于 Excel 表格或 SQL 表。
  • 每列可以是不同的数据类型(但同一列内类型一致)。
  • 具有行索引(index)和列索引(columns)。
df=pd.DataFrame({'Name':['Alice','Bob','Charlie'],'Age':[25,30,35],'City':['New York','Paris','Tokyo']})print(df)

输出:

Name Age City 0 Alice 25 New York 1 Bob 30 Paris 2 Charlie 35 Tokyo

特点:

  • 列可命名,支持按列名访问(如df['Name']
  • 支持多种数据输入格式(字典、列表、NumPy 数组、CSV 文件等)
  • 提供丰富的数据操作方法(筛选、分组、合并、透视等)

二、基本操作

1.创建 DataFrame

  • 从字典、列表、NumPy 数组、CSV/Excel 文件等创建。
# 从 CSV 读取df=pd.read_csv('data.csv')# 从字典创建data={'col1':[1,2],'col2':[3,4]}df=pd.DataFrame(data)

2.查看数据

df.head()# 查看前5行df.tail(3)# 查看后3行df.info()# 显示数据概要(类型、非空值等)df.describe()# 统计摘要(均值、标准差、四分位数等)df.shape# 返回 (行数, 列数)

3.索引与选择

  • 按列选择
    df['Name']# 返回 Seriesdf[['Name','Age']]# 返回 DataFrame
  • 按行选择
    df.loc[0]# 按标签索引(第0行)df.iloc[0]# 按位置索引(第0行)df.loc[0:1,'Name':'City']# 标签切片

4.条件筛选

df[df['Age']>25]df[(df['Age']>25)&(df['City']=='Tokyo')]

注意:使用&|而不是andor,且条件需加括号。


三、数据清洗常用操作

1.处理缺失值

df.isnull()# 检查缺失值(返回布尔 DataFrame)df.dropna()# 删除含缺失值的行df.fillna(0)# 用0填充缺失值df.fillna(method='ffill')# 前向填充

2.去重

df.duplicated()# 检查重复行df.drop_duplicates()# 删除重复行

3.数据类型转换

df['Age']=df['Age'].astype('float')pd.to_datetime(df['date_column'])# 转换为日期时间

四、数据操作进阶

1.分组(GroupBy)

df.groupby('City')['Age'].mean()
  • 类似 SQL 中的GROUP BY
  • 支持聚合函数:sum(),mean(),count(),agg()

2.合并与连接

  • pd.concat():沿轴拼接多个 DataFrame
  • pd.merge():类似 SQL 的 JOIN 操作
pd.merge(df1,df2,on='key')

3.透视表(Pivot Table)

pd.pivot_table(df,values='Age',index='City',aggfunc='mean')

五、时间序列支持

Pandas 对时间序列有强大支持:

ts=pd.date_range('2025-01-01',periods=10,freq='D')df=pd.DataFrame({'value':range(10)},index=ts)df.resample('W').sum()# 按周重采样

六、性能与注意事项

  • 向量化优于循环:尽量使用内置方法而非 for 循环。
  • 避免链式赋值:如df[df.A > 2]['B'] = new_val可能引发警告,应使用.loc
  • 内存优化:对于大文件,可使用dtype参数指定列类型,或使用chunksize分块读取。

总结

概念说明
Series一维带标签数组
DataFrame二维表格结构,核心分析对象
Index行/列标签,支持快速查找和对齐
Vectorized Operations高效的批量计算
Data I/O支持 CSV、Excel、JSON、SQL 等多种格式

掌握这些基础概念后,你就可以高效地进行数据加载、清洗、探索和分析了。

如需进一步学习,可参考官方文档:https://pandas.pydata.org/docs/

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/1 23:30:41

OmniThoughtV:面向多模态深度思考的高质量数据蒸馏

作者:岳元浩(顾城)、汪诚愚(熊兮)、黄俊(临在) 背景 近年来,多模态人工智能技术迅猛发展,推动了视觉、语言、语音等多种模态信息的深度融合与理解。尤其在多模态深度推理任务中, GPT-4V 等前沿模型通过模拟人类的链式思维过程&a…

作者头像 李华
网站建设 2026/8/2 15:38:21

面试不是考试,而是“技术交流与信任构建”

面试官所有问题都围绕三个核心目标:考察你有没有?(知识广度与技能匹配度)考察深不深?(原理深度与实战能力)考察能不能一起工作?(思维逻辑、沟通协作、潜力)网…

作者头像 李华
网站建设 2026/8/2 17:24:47

45、WPF 打印与 XPS 文档处理全解析

WPF 打印与 XPS 文档处理全解析 1. 打印固定文档(Printing FixedDocuments) 在处理固定文档打印时,需要将 Canvas 添加到 FixedPage 中,再把 FixedPage 以不太方便的方式添加到 PageContent 里,最后将 PageContent 加入 FixedDocument 的 Pages 集合。其实…

作者头像 李华
网站建设 2026/8/2 6:21:25

46、WPF应用开发:从打印到过渡效果与世界浏览器应用构建

WPF应用开发:从打印到过渡效果与世界浏览器应用构建 在软件开发中,打印功能、文档处理以及界面过渡效果都是提升用户体验和应用实用性的重要方面。下面将深入探讨在WPF应用开发中这些相关内容。 打印与文档处理的回顾与展望 在过往的开发经历中,我们在各种场景下实现过打…

作者头像 李华
网站建设 2026/8/2 16:38:46

【仿真测试】基于FPGA的完整64QAM通信链路实现,含频偏锁定,帧同步,定时点,Viterbi译码,信道,误码统计

目录 1.引言 2.算法仿真效果 3.算法涉及理论知识概要 3.1 217卷积编码/维特比译码 3.2 64QAM调制解调原理 3.3 上变频/下变频 3.4 基于PN导频和cordic的频偏锁定 3.5 基于相关峰的定时点提取 3.6 帧同步 3.7 采样判决 4.Verilog核心接口 5.参考文献 6.完整算法代码…

作者头像 李华
网站建设 2026/8/1 19:32:16

Day35:DMA 原理与架构

DMA 功能: 直接内存访问,实现外设与内存或内存间数据传输,无需 CPU 干预 大幅提高数据传输效率,释放 CPU 资源 STM32 DMA 特性: 多个通道 (如 DMA1 有 7 个通道,DMA2 有 5 个通道) 支持外设到内存、内存到外…

作者头像 李华