CSDN 完整教程
系列:《从小白到 AI 大模型开发工程师的进阶之路》 技术点:AI-0122 生成器 主人公:小蓝伞
本文是第 34 期,围绕【yield、生成器表达式、流式处理和内存占用】展开。示例用于复现实验;标注【建议验证】的部分需要按读者自己的 Windows、Python 版本和网络条件执行。
一、问题背景与适用场景
逐行筛选日志中的 ERROR 记录,文件再大也只处理当前行。 本期要把概念落成一个可观察、可回滚的小实践。
二、先给结论
yield 保存执行状态并按需产生数据;大文件处理保持流式消费,避免 list(generator) 把结果重新全部加载。 本期最小产出:大文件逐行处理器。
三、前置准备
Windows 10/11,建议 Python 3.11 或项目采用的兼容版本。
练习目录:
D:\ai-learning\issue-34;涉及文件、依赖或配置时先备份。不要提交 Token、密码和个人路径;未执行命令不得写成实测结果。
四、最小可复现实践
在练习目录保存并执行:
from io import StringIO def errors(stream): for line in stream: if line.startswith('ERROR'): yield line.rstrip() log = StringIO('INFO start\nERROR timeout\nINFO retry\nERROR refused\n') for line in errors(log): print(line)预期结果:只输出 ERROR 行,生成器被 for 消费时才执行。
五、关键原理与工程判断
1. 先定义输入和成功判据
yield 保存执行状态并按需产生数据;大文件处理保持流式消费,避免 list(generator) 把结果重新全部加载。
2. 保留状态和失败原因
把输入、输出、版本、目录和完整错误记入 README 或日志,便于定位而不是只写【失败】。
3. 小步执行与回滚
先跑最小样例,再一次改一个变量;危险操作先 dry-run、备份或 Git 提交。
六、常见问题与避坑
创建生成器后期待函数体立即执行;必须由 next、for 或其他消费者驱动。
用 list(generator) 收集全部数据;大文件场景保持流式消费并限制缓存。
重复遍历已经耗尽的生成器;需要新一轮结果时重新调用生成器函数。
七、验证清单
正常、边界、失败三类输入均有验证。
重新打开终端或进程后复验,排除缓存和当前会话影响。
产物能再次读取、运行或恢复;未实测部分标记【建议验证】。
八、面试题
本期技术点解决什么问题?解决输入、状态或失败边界的可控性。
为什么先做最小实践?降低变量数量,区分语法、环境和业务问题。
出现错误先做什么?保存完整错误,确认版本、目录、权限和输入。
如何判断真正生效?重启相关进程后,用独立命令和功能测试复核。
什么时候不能照搬示例?系统、版本、权限或输入契约不同,就要先调整并阅读官方文档。
九、本期小结与下一期
本期完成 大文件逐行处理器,把正确路径和失败路径都变成可验证动作。下一期继续学习资料库中的下一个技术点。点个关注不迷路,跟着小蓝伞把 Python 基础变成工程能力。可靠的程序也要能解释失败。
官方资料
9. Classes — Python 3.14.7 documentation
十、记录与回滚
建议记录时间、解释器版本、执行目录、关键输出和失败原因;出现异常先停止批量操作,保留现场后恢复备份或回退 Git。