清洗管线重构为严格三层架构:
- tango_analyser.py(底层:单词分析)
- task_processor.py(中层:文件 I/O、桶管理)
- workflow.py(顶层:状态机、任务推进)
- 移除旧的 batch_processor.py
新增配置文件系统:
- config.py:TOML 配置,相对路径相对配置文件目录解析
- 查找优先级 --config > cwd > 项目根 > ~ > 默认值
- count=None 语义为处理到文件末尾
项目目录整理:
- 根脚本归档到 scripts/analysis 与 scripts/legacy
- 文档归档到 docs/{design,history,analysis}
- 临时报告移到 reports/(已 gitignore)
文档质量:
- 新增 .markdownlint.json 与 scripts/mdlint.cmd
- 修复全部 14 个 md 文件的 markdownlint 警告
测试:74 passed(8 cleaner + 31 workflow + 6 tango + 15 validator + 14 config)
Legacy Scripts(已废弃脚本)
这个目录存放已被新架构取代的旧脚本,保留仅供参考。
文件清单
pipeline.py (443 行)
状态:已废弃,被 jclean 完全取代
原功能:
- 半自动流水线:处理
xinbiaori_tobe.txt的分割 + 拼音校正 - 输入格式:
汉字词:假名:或汉字词:假名:(第三段拼音为空) - 输出:分类到
auto_done.txt/review_pinyin.txt/review_split.txt/review_verb.txt/review_special.txt - 使用 jamdict 词典进行假名分割
被取代原因:
- 功能与现在的
jclean工作流完全重复 - 没有任务管理、状态机、配置文件等现代特性
- 输出文件固定,不支持批次隔离
现代替代:
jclean create task1 --source xinbiaori_tobe.txt
jclean run task1
apply_corrections.py (77 行)
状态:已废弃,历史修正已完成
原功能:
- 批量应用人工确认后的修正到
xinbiaori.txt - 硬编码了几十条修正规则(拼音手误、假名错误等)
- 修正格式:
(说明, 旧行, 新行)
被取代原因:
- 一次性脚本,历史数据修正已完成
- 新的工作流中,修正直接在 review 桶文件中编辑,重跑即可
现代替代:
# 人工修正 review_pinyin.txt 后重跑
jclean run task1 --bucket pinyin
使用建议
⚠️ 不要再使用这些脚本
这些脚本已经不维护,仅作为历史参考保留。所有功能都已迁移到 jclean 工具。
如果需要查看旧的处理逻辑,可以阅读代码,但不要运行。