“AI 味”是信任危机:yomiyasu 走红给所有 AIGC 产品上了一课
【免费下载链接】yomiyasuAI生成の日本語を自然な日本語へ推敲するAgent Skill / Agent Skill for Refining AI-Generated Japanese into Natural Japanese项目地址: https://gitcode.com/gh_mirrors/yo/yomiyasu
2026 年,一个名为yomiyasu(よみやす)的开源 Agent Skill 在中文社区悄然走红:它不做别的,专治“AI 生成日语”里那股说不清、道不明的别扭感——把“数据静悄悄地坏掉了”“地味に効く”这类句子,改写成主谓清晰、信息密度正常的自然日语。CSDN 上一批“新手完全指南”“Before→After 真实对比”“4 种部署方式”教程接连出现,社区实测的 linter 评分从 33 分提升到 100 分。
这个工具走红的背后,是一个被大多数 AIGC 产品团队低估的问题:用户对“AI 味”的容忍度正在快速下降,“AI 味”已经从风格瑕疵升级为信任赤字。本文结合 yomiyasu 的源码与验证语料,拆解它是如何把“不像 AI”做成可度量、可验收、可追溯的工程能力,并给出对 AIGC 产品团队的启示。
一、从“能生成”到“生成得不像 AI”:需求的重心迁移
两年前,AI 写作的卖点是“能生成”;今天,用户的抱怨重点变成了“一看就是 AI 写的”。这种需求迁移背后有三层事实,yomiyasu 的仓库都给出了可验证的证据。
第一层:单纯禁止词汇是无效的。yomiyasu 的语料构建脚本 scripts/build_corpus.py 里,保留着一组典型的“黑名单提示词”实验:让模型生成时绝对禁止使用“手触り”“解像度”“地味に効く”“静かに壊れる”“時間を溶かす”等 AI 味表达。结果如何?仓库里blacklist_ai/目录下的 24 篇样本显示,词汇层面的规避确实做到了,但“结构性的 AI 味”原封不动地留了下来。以 PR 说明样本 tests/corpus/blacklist_ai/03_pr_description_sonnet_casual.md 为例,它表面上没有任何被禁的比喻词,可通篇是“〜しました”“〜しました”的同一文末连缀,以及“従来は〜していました。同じユーザーの並行リクエストが〜”这类省略主语、依赖读者脑补的句式。也就是说:词表禁令治标不治本,AI 味的根源在句法骨架,不在单词。
第二层:形式通胀是肉眼可见的。仓库在 references/domains/tech.md 中引用了“Qiita 7 万篇文章统计”的调查结论:AI 普及后,技术文章的加粗密度与条目化比例急剧上升,而“怎么做”的操作细节同步稀薄化。yomiyasu 因此把“1,000 字加粗 1–2 处、条目占比 15% 以下”写进了领域规范——这不是文风洁癖,而是对读者注意力的保护。
第三层:人类基准线其实不低。仓库的对比基准 evals/comparison_benchmark.md 用同一主题做了三路对照:人类撰写的开源文本、素 LLM 输出、yomiyasu 改写结果。机械计测显示:人类文章 95/100 分,素 LLM 文章只有 33/100 分,yomiyasu 改写后 100/100 分;加粗频率从每千字 20.1 个(超警告线 6 倍多)降到 0,条目占比从 42.9% 降到 0。
用户的“不像 AI”诉求,本质上是要求输出回到人类写作的基准线上。而这条基准线,恰恰是大多数生成类产品从未量化过的东西。
二、从“禁止词表”到“结构重建”:七条语法骨架原则
yomiyasu 的核心不依赖禁用词表,而是对句子骨架做结构化重建。它的主文档 skills/yomiyasu/SKILL.md 将改写约束收敛为 7 条原则,全部指向同一件事:让读者以最小认知代价还原“谁、对谁、做了什么、在什么条件下”。
- 主谓・修饰・条件点检:还原主语、谓语、修饰语的对应关系,条件、例外、否定、并列在改写前后必须同样可追踪;
- 文的作用与文体保持:区分说明、请求、建议、预定,只修正与作用不符的文末,不为了“语尾多样”而刻意打散;
- 拟人化整理:把“工具/概念拥有情感意志”的表述改掉,但客观描述系统行为的非生物主语保留;
- 比喻动词具体化:
壊れる、倒す、効く、溶かす等按原意的“含み”(语气与评价倾向)改写为日常动词; - 前置语与否定对仗的取舍:只有删掉也不改变主张与比重的前置才删;
- 信息不增补:绝不自行添加原文没有的主体、原因、数值、情感;
- 句长・读点・装饰调整:平均句长 30–45 字、单句读点 0–2 个、清理无信息量的文末冒号与装饰符号。
对照仓库里同一篇 PR 说明的改写前后,可以直观看到结构重建的样子:素 LLM 的“リクエスト内の同期呼び出しから非同期キューでの実行に切り替えた”(谁在切、怎么切,全靠读者猜),被改写为“リクエストは期限切れを検知するとリフレッシュ要求をキューに登録し、ワーカーがその要求を処理する”(动作主显式、条件与动作一一对应)。原文 tests/corpus/raw_ai/03_pr_description_sonnet_casual.md 与改写版 tests/corpus/yomiyasu_rewritten/03_pr_description_sonnet_casual.md 的差异,就是“词表替换”与“骨架重建”的分野。
这套规则的工程化配套同样关键。词表与改写候选被沉淀在 references/slop-catalog.md,但明确标注“不是机械替换表”:例如壊れる只有在指数据、系统时才改写成“おかしくなる/使えなくなる”,而“お腹を壊す”这类字面义要原样保留——边界用例 tests/corpus/edge_cases/edge_kowareru_37.md 专门为此建了一条回归样本。领域层则通过 references/domains/tech.md、business、essay 三个 domain 控制改写方向:tech 侧重操作具体性,business 强调责任主体与条件边界,essay 保留个人语气、去掉大词化。规则是结构性的,兜底是语料化的,这正是它敢说“不误伤”的底气。
三、可量化的“AI 味”:lint 评分如何进入内容验收流程
yomiyasu 走红最有工程价值的部分,是它的配套静态检查器 scripts/yomiyasu_lint.py——一个纯 Python 标准库实现、零依赖的“AI 味”量化器。它把不可言说的“读起来像 AI”压缩成一行可仲裁的分数:
# 常规检查 python3 scripts/yomiyasu_lint.py README.md # 严格模式:有 warning 即返回退出码 1(用于 CI / Git Hook) python3 scripts/yomiyasu_lint.py article.md --strict # 结构化输出,便于接入平台 python3 scripts/yomiyasu_lint.py article.md --json评分机制在源码里写得非常直白(见 scripts/yomiyasu_lint.py 第 1996 行附近):100 分满分起扣,warning/error 每项扣 5 分,info 每项扣 2 分,扣完为止。检查维度包括:每千字加粗频率(推荐 ≤2.0、警告 >3.0)、条目占比(推荐 ≤15%、警告 >25%)、同一文末 3 连检测、文末装饰性冒号、emoji、空泛的前置导入(如“本記事では〜をご紹介します”),甚至连“Markdown 加粗可能不被渲染”的写法(bold_not_rendered)都单独列项。这意味着“AI 味”第一次拥有了可仲裁的量化口径,可以直接进入 PR 验收、文档发布检查这类工程流程。
与之配套的是差分校验器 scripts/yomiyasu_diff.py,它解决“量化”之外的另一半问题——语义保真。工具不调用任何模型,只比较原文与改写稿:列出增减的词、文末类型(依頼/勧誘/義務/評価/可能/推量…)的变化、条目与段落结构变化、文头连接与指示语的可追溯性,并允许通过--stance=勧め|決まり|説明指定文档立场(yomiyasu 认为文末是日语里承载“谁在动作”的关键信息)。它输出的不是“自动判定语义等价”,而是“语义易漂移的位置清单”,由人(或模型)逐条仲裁。
仓库用一套体系化的语料验证了这套流程的可重复性:tests/corpus/benchmark_results.json 记录了 163 篇样本的评分统计——24 篇“黑名单提示词”生成稿平均 97.4 分(说明词表禁令在机械指标上“过关”,但结构性问题仍由其他维度兜住)、48 篇 yomiyasu 改写稿平均 98.0 分、16 篇人类写作平均 98.7 分、49 篇边界用例全部满分。“像不像 AI”由此从审美判断变成了可回归、可防退化的工程指标。
四、其他语言、其他内容类型的“AI 味”治理机会
yomiyasu 目前刻意专注日语单语种——这不是能力不足,而是刻意为之。日语对“AI 味”特别敏感:主语高频省略、文末形态承担“谁在动作”的语法功能、敬体/常体与立场(勧め/決まり/説明)纠缠在一起。yomiyasu 的 linter 把“同一文末 3 连”当作硬指标,正是因为日语里语尾重复会直接摧毁“动作主可读性”。这份对语言结构的敬畏,恰恰揭示了可迁移的治理框架:
- 针对中文的“AI 味”,可复用的是“SVOCM 骨架重建 + 形式通胀阈值 + 语义保真 diff”的三件套,而不是照抄日语词表;“赋能”“抓手”“颗粒度”“链路”等流行词的治理同样需要“结构规则 + 语料兜底”而非禁令;
- 针对内容类型,仓库语料已经覆盖了技术文章、故障报告、PR 说明、Slack 公告、技术选型备忘录、规格书草稿、代码评审、随笔回顾共 8 类实务文本 × 3 种文体(见 scripts/build_corpus.py)。这说明“AI 味治理”不是写作文风问题,而是文档生产流水线上的质量关卡——与 lint、测试、CI 同构;
- 针对产品形态,yomiyasu 提供了 4 种安装路径(
npx skills add nanaism/yomiyasu、gh skill install、npx openskills install、Claude Code 插件市场)以及--strict/--json输出,等于把“改写能力”做成了可嵌入任何编码 Agent 的可审计服务。这正是 AIGC 产品最稀缺的:不是更强的生成,而是可信的收口。
五、给 AIGC 产品团队的三个建议
结合 yomiyasu 的仓库实现,它实际上给所有 AIGC 产品团队上了一堂“信任工程”课,核心可以压缩为三条:
第一,用结构规则取代词表禁令。黑名单实验(scripts/build_corpus.py 中的 BLACKLIST_PROMPT_SUFFIX)已经证明,禁止 10 个词,模型会换出 100 个同样空洞的表达;只有把规则定义在“主谓对应、文末立场、信息密度、形式通胀”这些结构维度上,输出才能稳定回到人类基准线。
第二,让“不像 AI”可度量、可验收,且必须与语义保全绑定。一个没有评分、没有 diff 的“去 AI 味”功能,无法进入任何工程验收流程。yomiyasu 的做法是“linter 打分(scripts/yomiyasu_lint.py)+ diff 保真(scripts/yomiyasu_diff.py)”双闸门:量化负责挡住“AI 味”,差分负责挡住“改写时偷改语义”。两条缺一条,所谓“去 AI 味”就只是新的营销话术。
第三,用分层语料库和边界用例守住改写底线。真正让用户信任“改写不误伤”的,不是声称,而是可复现的回归集:人类文本不该被乱改(human/)、字面义不该被误判(如“お腹を壊す”)、改完不该偏离原文(yomiyasu_rewritten/ 与原文一一对照)。163 篇语料 + 50 个回归 fixture + 每一条 lint 规则都有对应单测,这才是“AI 味治理”能从玩具变成基础设施的分水岭。
yomiyasu 的 README 最后一行写着:“このREADMEは、『yomiyasu』を用いて推敲されています”——连自己的文档都是拿工具推敲过的。这种“写给别人看的每一句话都经得起检查”的姿态,或许才是它走红背后真正的信号:当读者开始怀疑 AI 文本的真实性与可信度时,能让输出“不像 AI”的能力,就是 AIGC 产品最稀缺的信任资产。
【免费下载链接】yomiyasuAI生成の日本語を自然な日本語へ推敲するAgent Skill / Agent Skill for Refining AI-Generated Japanese into Natural Japanese项目地址: https://gitcode.com/gh_mirrors/yo/yomiyasu
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考