Python如何处理Excel文件？-Python教程-PHP中文网

「问题说明」

「方案2」

首页

后端开发

Python教程

Python如何处理Excel文件？

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

May 08, 2023 pm 05:58 PM

excel python

「问题说明」

这次要处理的excel有两个sheet，要根据其中一个sheet的数据来计算另外一个sheet的值。造成问题的点在于，要计算值的sheet里不仅仅有数值，还有公式。我们来看一下：

Python如何处理Excel文件？

如上图所示，这个excel一共有两个sheet:CP和DS，我们要按照一定的业务规则，根据CP中的数据计算DS对应单元格的数据。图中蓝色方框框出来的是带公式的，而其他区域是数值。

我们来看看，如果我们按照之前说的处理逻辑，把excel一次性批量读取到dataframe处理，然后再一次性批量写回去有啥问题。这部分代码如下：

import pandas as pd
import xlwings as xw
 
#要处理的文件路径
fpath = "data/DS_format.xlsm"
 
#把CP和DS两个sheet的数据分别读入pandas的dataframe
cp_df = pd.read_excel(fpath,sheet_name="CP",header=[0])
ds_df = pd.read_excel(fpath,sheet_name="DS",header=[0,1])
 
#计算过程省略......
 
#保存结果到excel       
app = xw.App(visible=False,add_book=False)
ds_format_workbook = app.books.open(fpath)
ds_worksheet = ds_format_workbook.sheets["DS"]
ds_worksheet.range("A1").expand().options(index=False).value = ds_df 
ds_format_workbook.save()
ds_format_workbook.close()
app.quit()

登录后复制

如上代码存在的问题在于，pd.read_excel()方法从excel里读取数据到dataframe的时候，对于有公式的单元格，会直接读取公式计算的结果（如果没有结果则返回Nan），而我们写入excel的时候是直接把dataframe一次性批量写回的，这样之前带公式的单元格，被写回的就是计算出来的值或Nan，而丢掉了公式。

好了，问题出现了，我们该如何解决呢？这里会想到两个思路：

dataframe写回excel的时候，不要一次性批量写回，而是通过行和列的迭代，只写回计算的数据，有公式的单元格不动；
读取excel的时候，有没有办法做到对于有公式的单元格，读取公式，而不是读取公式计算的结果；

我确实按照上面两个思路分别尝试了一下，我们一起来看一下。

「方案1」

如下代码尝试遍历dataframe然后按单元格写入对应的值，有公式的单元格不动

#根据ds_df来写excel，只写该写的单元格
for row_idx,row in ds_df.iterrows():
    total_capabity_val = row[(&#39;Total&#39;,&#39;Capabity&#39;)].strip()
    total_capabity1_val = row[(&#39;Total&#39;,&#39;Capabity.1&#39;)].strip()
    #Total和1Gb  Eqv.所在的行不写
    if total_capabity_val!= &#39;Total&#39; and total_capabity_val != &#39;1Gb  Eqv.&#39;:
        #给Delta和LOI赋值
        if total_capabity1_val == &#39;LOI&#39; or total_capabity1_val == &#39;Delta&#39;:
            ds_worksheet.range((row_idx + 3 ,3)).value = row[(&#39;Current week&#39;,&#39;BOH&#39;)]
            print(f"ds_sheet的第{row_idx + 3}行第3列被设置为{row[(&#39;Current week&#39;,&#39;BOH&#39;)]}") 
        #给Demand和Supply赋值
        if total_capabity1_val == &#39;Demand&#39; or total_capabity1_val == &#39;Supply&#39;:
            cp_datetime_columns = cp_df.columns[53:]
            for col_idx in range(4,len(ds_df.columns)):
                ds_datetime = ds_df.columns.get_level_values(1)[col_idx]
                ds_month = ds_df.columns.get_level_values(0)[col_idx]
                if type(ds_datetime) == str and ds_datetime != &#39;TTL&#39; and ds_datetime != &#39;Total&#39; and (ds_datetime in cp_datetime_columns):
                    ds_worksheet.range((row_idx + 3,col_idx + 1)).value = row[(f&#39;{ds_month}&#39;,f&#39;{ds_datetime}&#39;)]
                    print(f"ds_sheet的第{row_idx + 3}行第{col_idx + 1}列被设置为{row[(f&#39;{ds_month}&#39;,f&#39;{ds_datetime}&#39;)]}") 
                elif type(ds_datetime) == datetime.datetime and (ds_datetime in cp_datetime_columns):
                    ds_worksheet.range((row_idx + 3,col_idx + 1)).value = row[(f&#39;{ds_month}&#39;,ds_datetime)]     
                    print(f"ds_sheet的第{row_idx + 3}行第{col_idx + 1}列被设置为{row[(f&#39;{ds_month}&#39;,ds_datetime)]}")

登录后复制

如上的代码确实解决了问题，也即有公式的单元格的公式被保留了。但是，根据我们文章开头提到的Python处理excel的忠告，这个代码是有严重性能问题的，因为它通过api频繁操作excel的单元格，导致写入非常慢，在我的老迈Mac本上一共跑了40分钟，简直不可接受，故该方案只能放弃。

「方案2」

这个方案是希望做到读取excel有公式值的单元格的时候，能保留公式值。这只能从各个Python的excel库的API来寻找有无对应的方法了。Pandas的read_excel()方法我仔细看了一下没有对应的参数可以支持。Openpyxl我倒是找到了一个API可以支持，如下：

import openpyxl
ds_format_workbook = openpyxl.load_workbook(fpath,data_only=False)
ds_wooksheet = ds_format_workbook[&#39;DS&#39;]
ds_df =  pd.DataFrame(ds_wooksheet.values)

登录后复制

关键是这里的data_only参数，为True则返回数据，为False的情况下可以保留公式值

本以为找到了对应解决方案正一顿窃喜，但当我看到通过openpyxl读取到dataframe中的数据结构的时候，才被破了一盆冷水。因为我的excel表的表头是比较复杂的两级的表头，表头中还存在合并和拆分单元格的情况，这样的表头被openpyxl读取到dataframe后，没有按照pandas的多级索引进行处理，而是简单的被处理成数字索引0123...

但我对dataframe的计算会依赖多级索引，因此openpyxl的这种处理方式导致我后面的计算无法处理。

openpyxl不行，再看看xlwings呢？通过对xlwings API文档的一通寻找，还真给我找到了，如下所示：

Python如何处理Excel文件？

Range类提供了一个Property叫formula，可以获取和设置formula。

看到这个我简直如获至宝，赶紧代码操练起来。也许出于惯性，又或许是被之前按行列单元格操作excel的效率搞怕了，我直接先想到的方案还是一次性批量搞定，也即一次性读取excel所有的公式，然后再一次性写回去，所以我一开始的代码是这样的：

#使用xlwings来读取formula
app = xw.App(visible=False,add_book=False)
ds_format_workbook = app.books.open(fpath)
ds_worksheet = ds_format_workbook.sheets["DS"]
#先把所有公式一次性读取并保存下来
formulas = ds_worksheet.used_range.formula
 
#中间计算过程省略...
 
#一次性把所有公式写回去
ds_worksheet.used_range.formula = formulas

登录后复制

可是我想错了，ds_worksheet.used_range.formula让我误解只会返回excel中的有公式的单元格的公式，但其实它返回的是所有的单元格，只是对有公式的单元格保留了公式。所以，当我重新写回公式的时候，会覆盖掉我通过dataframe计算完并写入excel的其他的值。

既然这样的话，那我只能对有公式的单元格分别处理而不是一次性处理了，所以代码得这样写：

#使用xlwings来读取formula
app = xw.App(visible=False,add_book=False)
ds_format_workbook = app.books.open(fpath)
ds_worksheet = ds_format_workbook.sheets["DS"]
 
#保留excel中的formula
#找到DS中Total所在的行，Total之后的行都是formula
row = ds_df.loc[ds_df[(&#39;Total&#39;,&#39;Capabity&#39;)]==&#39;Total &#39;]
total_row_index = row.index.values[0]
#获取对应excel的行号(dataframe把两层表头当做索引，从数据行开始计数，而且从0开始计数。excel从表头就开始计数，而且从1开始计数)
excel_total_row_idx = int(total_row_index+2)
#获取excel最后一行的索引
excel_last_row_idx = ds_worksheet.used_range.rows.count
#保留按日期计算的各列的formula
I_col_formula = ds_worksheet.range(f&#39;I3:I{excel_total_row_idx}&#39;).formula
N_col_formula = ds_worksheet.range(f&#39;N3:N{excel_total_row_idx}&#39;).formula
T_col_formula = ds_worksheet.range(f&#39;T3:T{excel_total_row_idx}&#39;).formula
U_col_formula = ds_worksheet.range(f&#39;U3:U{excel_total_row_idx}&#39;).formula
Z_col_formula = ds_worksheet.range(f&#39;Z3:Z{excel_total_row_idx}&#39;).formula
AE_col_formula = ds_worksheet.range(f&#39;AE3:AE{excel_total_row_idx}&#39;).formula
AK_col_formula = ds_worksheet.range(f&#39;AK3:AK{excel_total_row_idx}&#39;).formula
AL_col_formula = ds_worksheet.range(f&#39;AL3:AL{excel_total_row_idx}&#39;).formula
#保留Total行开始一直到末尾所有行的formula
total_to_last_formula = ds_worksheet.range(f&#39;A{excel_total_row_idx+1}:AL{excel_last_row_idx}&#39;).formula
 
#中间计算过程省略...
 
#保存结果到excel                 
#直接把ds_df完整赋值给excel，会导致excel原有的公式被值覆盖
ds_worksheet.range("A1").expand().options(index=False).value = ds_df 
#用之前保留的formulas，重置公式
ds_worksheet.range(f&#39;I3:I{excel_total_row_idx}&#39;).formula = I_col_formula
ds_worksheet.range(f&#39;N3:N{excel_total_row_idx}&#39;).formula = N_col_formula
ds_worksheet.range(f&#39;T3:T{excel_total_row_idx}&#39;).formula = T_col_formula
ds_worksheet.range(f&#39;U3:U{excel_total_row_idx}&#39;).formula = U_col_formula
ds_worksheet.range(f&#39;Z3:Z{excel_total_row_idx}&#39;).formula = Z_col_formula
ds_worksheet.range(f&#39;AE3:AE{excel_total_row_idx}&#39;).formula = AE_col_formula
ds_worksheet.range(f&#39;AK3:AK{excel_total_row_idx}&#39;).formula = AK_col_formula
ds_worksheet.range(f&#39;AL3:AL{excel_total_row_idx}&#39;).formula = AL_col_formula
ds_worksheet.range(f&#39;A{excel_total_row_idx+1}:AL{excel_last_row_idx}&#39;).formula = total_to_last_formula
 
ds_format_workbook.save()
ds_format_workbook.close()
app.quit()

登录后复制

经测试，如上代码完美地解决我的需求，而且性能上也完全没问题。

以上是Python如何处理Excel文件？的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

热工具

热门话题

gmail邮箱登陆入口在哪里

7480

CakePHP 教程

1377

steam的账户名称是什么格式

win11激活密钥永久

NYT连接提示和答案

显示更多

Related knowledge

mysql 是否要付费 Apr 08, 2025 pm 05:36 PM

MySQL 有免费的社区版和收费的企业版。社区版可免费使用和修改，但支持有限，适合稳定性要求不高、技术能力强的应用。企业版提供全面商业支持，适合需要稳定可靠、高性能数据库且愿意为支持买单的应用。选择版本时考虑的因素包括应用关键性、预算和技术技能。没有完美的选项，只有最合适的方案，需根据具体情况谨慎选择。

mysql安装后怎么使用 Apr 08, 2025 am 11:48 AM

文章介绍了MySQL数据库的上手操作。首先，需安装MySQL客户端，如MySQLWorkbench或命令行客户端。1.使用mysql-uroot-p命令连接服务器，并使用root账户密码登录；2.使用CREATEDATABASE创建数据库，USE选择数据库；3.使用CREATETABLE创建表，定义字段及数据类型；4.使用INSERTINTO插入数据，SELECT查询数据，UPDATE更新数据，DELETE删除数据。熟练掌握这些步骤，并学习处理常见问题和优化数据库性能，才能高效使用MySQL。

mysql下载文件损坏无法安装的修复方案 Apr 08, 2025 am 11:21 AM

MySQL下载文件损坏，咋整？哎，下载个MySQL都能遇到文件损坏，这年头真是不容易啊！这篇文章就来聊聊怎么解决这个问题，让大家少走弯路。读完之后，你不仅能修复损坏的MySQL安装包，还能对下载和安装过程有更深入的理解，避免以后再踩坑。先说说为啥下载文件会损坏这原因可多了去了，网络问题是罪魁祸首，下载过程中断、网络不稳定都可能导致文件损坏。还有就是下载源本身的问题，服务器文件本身就坏了，你下载下来当然也是坏的。另外，一些杀毒软件过度“热情”的扫描也可能造成文件损坏。诊断问题：确定文件是否真的损坏

mySQL下载完安装不了 Apr 08, 2025 am 11:24 AM

MySQL安装失败的原因主要有：1.权限问题，需以管理员身份运行或使用sudo命令；2.依赖项缺失，需安装相关开发包；3.端口冲突，需关闭占用3306端口的程序或修改配置文件；4.安装包损坏，需重新下载并验证完整性；5.环境变量配置错误，需根据操作系统正确配置环境变量。解决这些问题，仔细检查每个步骤，就能顺利安装MySQL。

如何针对高负载应用程序优化 MySQL 性能？ Apr 08, 2025 pm 06:03 PM

MySQL数据库性能优化指南在资源密集型应用中，MySQL数据库扮演着至关重要的角色，负责管理海量事务。然而，随着应用规模的扩大，数据库性能瓶颈往往成为制约因素。本文将探讨一系列行之有效的MySQL性能优化策略，确保您的应用在高负载下依然保持高效响应。我们将结合实际案例，深入讲解索引、查询优化、数据库设计以及缓存等关键技术。1.数据库架构设计优化合理的数据库架构是MySQL性能优化的基石。以下是一些核心原则：选择合适的数据类型选择最小的、符合需求的数据类型，既能节省存储空间，又能提升数据处理速度

MySQL安装后服务无法启动的解决办法 Apr 08, 2025 am 11:18 AM

MySQL拒启动？别慌，咱来排查！很多朋友安装完MySQL后，发现服务死活启动不了，心里那个急啊！别急，这篇文章带你从容应对，揪出幕后黑手！读完后，你不仅能解决这个问题，还能提升对MySQL服务的理解，以及排查问题的思路，成为一名更强大的数据库管理员！MySQL服务启动失败，原因五花八门，从简单的配置错误到复杂的系统问题都有可能。咱们先从最常见的几个方面入手。基础知识：服务启动流程简述MySQL服务启动，简单来说，就是操作系统加载MySQL相关的文件，然后启动MySQL守护进程。这其中涉及到配置

mysql安装后怎么优化数据库性能 Apr 08, 2025 am 11:36 AM

MySQL性能优化需从安装配置、索引及查询优化、监控与调优三个方面入手。1.安装后需根据服务器配置调整my.cnf文件，例如innodb_buffer_pool_size参数，并关闭query_cache_size；2.创建合适的索引，避免索引过多，并优化查询语句，例如使用EXPLAIN命令分析执行计划；3.利用MySQL自带监控工具(SHOWPROCESSLIST,SHOWSTATUS)监控数据库运行状况，定期备份和整理数据库。通过这些步骤，持续优化，才能提升MySQL数据库性能。

mysql 需要互联网吗 Apr 08, 2025 pm 02:18 PM

MySQL 可在无需网络连接的情况下运行，进行基本的数据存储和管理。但是，对于与其他系统交互、远程访问或使用高级功能（如复制和集群）的情况，则需要网络连接。此外，安全措施（如防火墙）、性能优化（选择合适的网络连接）和数据备份对于连接到互联网的 MySQL 数据库至关重要。

See all articles

Python如何处理Excel文件？

「问题说明」

「方案1」

「方案2」

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题