python频繁写入文件怎么提速-Python教程-PHP中文网

首页

后端开发

Python教程

python频繁写入文件怎么提速

尚

Jun 26, 2019 pm 02:52 PM

python频繁写入文件怎么提速

问题背景：有一批需要处理的文件，对于每一个文件，都需要调用同一个函数进行处理，相当耗时。

有没有加速的办法呢？当然有啦，比如说你将这些文件分成若干批，每一个批次都调用自己写的python脚本进行处理，这样同时运行若干个python程序也可以进行加速。

有没有更简单的方法呢？比如说，我一个运行的一个程序里面，同时分为多个线程，然后进行处理？

大概思路:将这些个文件路径的list，分成若干个，至于分成多少，要看自己cpu核心有多少，比如你的cpu有32核的，理论上就可以加速32倍。

代码如下：

# -*-coding:utf-8-*-
import numpy as np
from glob import glob
import math
import os
import torch
from tqdm import tqdm
import multiprocessing
label_path = &#39;/home/ying/data/shiyongjie/distortion_datasets/new_distortion_dataset/train/label.txt&#39;
file_path = &#39;/home/ying/data/shiyongjie/distortion_datasets/new_distortion_dataset/train/distortion_image&#39;
save_path = &#39;/home/ying/data/shiyongjie/distortion_datasets/new_distortion_dataset/train/flow_field&#39;
r_d_max = 128
image_index = 0
txt_file = open(label_path)
file_list = txt_file.readlines()
txt_file.close()
file_label = {}
for i in file_list:
    i = i.split()
    file_label[i[0]] = i[1]
r_d_max = 128
eps = 1e-32
H = 256
W = 256
def generate_flow_field(image_list):
    for image_file_path in ((image_list)):
        pixel_flow = np.zeros(shape=tuple([256, 256, 2]))  # 按照pytorch中的grid来写
        image_file_name = os.path.basename(image_file_path)
        # print(image_file_name)
        k = float(file_label[image_file_name])*(-1)*1e-7
        # print(k)
        r_u_max = r_d_max/(1+k*r_d_max**2)  # 计算出畸变校正之后的对角线的理论长度
        scale = r_u_max/128  # 将这个长度压缩到256的尺寸，会有一个scale，实际上这里写128*sqrt(2)可能会更加直观
        for i_u in range(256):
            for j_u in range(256):
                x_u = float(i_u - 128)
                y_u = float(128 - j_u)
                theta = math.atan2(y_u, x_u)
                r = math.sqrt(x_u ** 2 + y_u ** 2)
                r = r * scale  # 实际上得到的r，即没有resize到256×256的图像尺寸size，并且带入公式中
                r_d = (1.0 - math.sqrt(1 - 4.0 * k * r ** 2)) / (2 * k * r + eps)  # 对应在原图（畸变图）中的r
                x_d = int(round(r_d * math.cos(theta)))
                y_d = int(round(r_d * math.sin(theta)))
                i_d = int(x_d + W / 2.0)
                j_d = int(H / 2.0 - y_d)
                if i_d < W and i_d >= 0 and j_d < H and j_d >= 0:  # 只有求的的畸变点在原图中的时候才进行赋值
                    value1 = (i_d - 128.0)/128.0
                    value2 = (j_d - 128.0)/128.0
                    pixel_flow[j_u, i_u, 0] = value1  # mesh中存储的是对应的r的比值，在进行畸变校正的时候，给定一张这样的图，进行找像素即可
                    pixel_flow[j_u, i_u, 1] = value2
# 保存成array格式
        saved_image_file_path = os.path.join(save_path, image_file_name.split(&#39;.&#39;)[0] + &#39;.npy&#39;)
        pixel_flow = pixel_flow.astype(&#39;f2&#39;)  # 将数据的格式转换成float16类型， 节省空间
        # print(saved_image_file_path)
        # print(pixel_flow)
        np.save(saved_image_file_path, pixel_flow)
    return
if __name__ == &#39;__main__&#39;:
    file_list = glob(file_path + &#39;/*.JPEG&#39;)
    m = 32
    n = int(math.ceil(len(file_list) / float(m)))  # 向上取整
    result = []
    pool = multiprocessing.Pool(processes=m)  # 32进程
    for i in range(0, len(file_list), n):
        result.append(pool.apply_async(generate_flow_field, (file_list[i: i+n],)))
    pool.close()
    pool.join()

登录后复制

在上面的代码中，函数

generate_flow_field(image_list)

需要传入一个list，然后对于这个list进行操作，之后对操作的结果进行保存

所以，只需要将你需要处理的多个文件，切分成尽量等大小的list，然后再对每一个list，开一个线程进行处理即可

上面的主函数：

if __name__ == &#39;__main__&#39;:
    file_list = glob(file_path + &#39;/*.JPEG&#39;)  # 将文件夹下所有的JPEG文件列成一个list
    m = 32  # 假设CPU有32个核心
    n = int(math.ceil(len(file_list) / float(m)))  # 每一个核心需要处理的list的数目
    result = []
    pool = multiprocessing.Pool(processes=m)  # 开32线程的线程池
    for i in range(0, len(file_list), n):
        result.append(pool.apply_async(generate_flow_field, (file_list[i: i+n],)))  # 对每一个list都用上面我们定义的函数进行处理
    pool.close()  # 处理结束之后，关闭线程池
    pool.join()

登录后复制

主要是这样的两行代码，一行是

pool = multiprocessing.Pool(processes=m)  # 开32线程的线程池

登录后复制

用来开辟线程池

另外一行是

result.append(pool.apply_async(generate_flow_field, (file_list[i: i+n],)))  # 对每一个list都用上面我们定义的函数进行处理

登录后复制

对于线程池，用apply_async()同时跑generate_flow_field这个函数，传入的参数是：file_list[i: i+n]

实际上apply_async()这个函数的作用是所有的线程同时跑，速度是比较快的。

更多Python相关技术文章，请访问Python教程栏目进行学习！

以上是python频繁写入文件怎么提速的详细内容。更多信息请关注PHP中文网其他相关文章！

本站声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

热AI工具

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

免费脱衣服图片

Clothoff.io

AI脱衣机

AI Hentai Generator

免费生成ai无尽的。

显示更多

热工具

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

中文版，非常好用

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

显示更多

热门话题

gmail邮箱登陆入口在哪里

7476

CakePHP 教程

1377

steam的账户名称是什么格式

win11激活密钥永久

NYT连接提示和答案

显示更多

Related knowledge

如何解决Linux终端中查看Python版本时遇到的权限问题？ Apr 01, 2025 pm 05:09 PM

Linux终端中查看Python版本时遇到权限问题的解决方法当你在Linux终端中尝试查看Python的版本时，输入python...

在Python中如何高效地将一个DataFrame的整列复制到另一个结构不同的DataFrame中？ Apr 01, 2025 pm 11:15 PM

在使用Python的pandas库时，如何在两个结构不同的DataFrame之间进行整列复制是一个常见的问题。假设我们有两个Dat...

如何在10小时内通过项目和问题驱动的方式教计算机小白编程基础？ Apr 02, 2025 am 07:18 AM

如何在10小时内教计算机小白编程基础？如果你只有10个小时来教计算机小白一些编程知识，你会选择教些什么�...

Python中如何通过字符串动态创建对象并调用其方法？ Apr 01, 2025 pm 11:18 PM

在Python中，如何通过字符串动态创建对象并调用其方法？这是一个常见的编程需求，尤其在需要根据配置或运行...

Uvicorn是如何在没有serve_forever()的情况下持续监听HTTP请求的？ Apr 01, 2025 pm 10:51 PM

Uvicorn是如何持续监听HTTP请求的？Uvicorn是一个基于ASGI的轻量级Web服务器，其核心功能之一便是监听HTTP请求并进�...

哪些流行的Python库及其用途？ Mar 21, 2025 pm 06:46 PM

本文讨论了诸如Numpy，Pandas，Matplotlib，Scikit-Learn，Tensorflow，Tensorflow，Django，Blask和请求等流行的Python库，并详细介绍了它们在科学计算，数据分析，可视化，机器学习，网络开发和H中的用途

FastAPI中如何处理逗号分隔的列表查询参数？ Apr 02, 2025 am 06:51 AM

如何在使用 Fiddler Everywhere 进行中间人读取时避免被浏览器检测到？ Apr 02, 2025 am 07:15 AM

使用FiddlerEverywhere进行中间人读取时如何避免被检测到当你使用FiddlerEverywhere...

See all articles

python频繁写入文件怎么提速

热AI工具

Undresser.AI Undress

AI Clothes Remover

Undress AI Tool

Clothoff.io

AI Hentai Generator

热门文章

热工具

记事本++7.3.1

SublimeText3汉化版

禅工作室 13.0.1

Dreamweaver CS6

SublimeText3 Mac版

热门话题