Python 数据分析性能耗时、内存和结果正确性一起看分析脚本快了多少不能只用墙钟时间回答。vectorize 可能节省 CPU却拉高峰值内存分块处理省内存也可能增加 I/O。先看任务真正受哪类资源限制。把流水线分段测量读取、清洗、连接、聚合和写出分别计时并记录输入行数和峰值内存。重复运行前说明缓存状态避免把第二次读取更快误认为代码优化。优化前先锁住结果为关键字段保存校验和、行数和聚合摘要。替换 apply、修改 dtype 或启用并行后先确认缺失值与浮点误差仍在可接受范围。用代表性数据规模测试不只跑玩具样本。报告中区分 CPU 时间与等待时间。并行任务同时观察进程数和内存峰值。数字要带条件硬件、Python 与库版本、数据格式、重复次数都写进记录。没有这些条件单独的“提速几倍”对下一位维护者帮助很小。性能调优像整理衣柜不是塞得越满越好而是知道空间花在哪里。正确性和资源账一起算优化才算完整。