news 2026/9/30 18:37:43

Hemmingway-1:27B 参数的开源写作模型,如何用 26 万 token 上下文写好日常消息

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Hemmingway-1:27B 参数的开源写作模型,如何用 26 万 token 上下文写好日常消息
  • 大模型
  • AI 写作

【免费下载链接】Hemmingway-1

项目地址:https://ai.gitcode.com/hf_mirrors/Altworld/Hemmingway-1
点击查看免费下载

本篇技术指南以 Hemmingway-1 模型仓库的 README.md 为骨架,完整梳理该 27B 开源写作模型的设计定位、评测方法论与评测结果、一键部署与调用方式、许可证与使用边界。读者读完可掌握如何基于仓库内的 config.json、generation_config.json、chat_template.jinja 与 tokenizer_config.json 等文件理解模型结构并落地运行。

一、模型定位:为"人们每天都在写的东西"而生

Hemmingway-1 是由 Altworld 发布的 27B 参数开源语言模型,其定位不是通用聊天助手,而是日常写作模型——消息、邮件、给同事的尴尬留言、拖了很久的那件事。README 的原话是:大部分模型给你一份房东通知会附带三种选项、一段前言和一段解释选项的文字,而 Hemmingway-1 直接给你文本本身。

  • 参数量:27B(仓库 model.safetensors.index.json 中 metadata.total_parameters 为 26,895,998,464,约 26.9B 参数,权重以 bfloat16 存储)
  • 基座模型:Qwen3.8-27B(README 与 LICENSE 均明确声明,基座模型由 Qwen 团队发布,遵循 Apache License 2.0)
  • 上下文长度:262,144 tokens(262K)
  • 许可证:CC BY-NC 4.0,非商业免费使用;商业使用需另行协议
  • 能力标签:creative-writing、chat、altworld

二、评测方法论:盲测、双向、异模型裁判

README 明确披露其评测方法:在八十个真实请求上测试,每个答案与另一个模型对同一请求的答案两两对战,顺序打乱使裁判不知道哪份是哪份。所有对战均采用盲测,且以两种顺序各跑一遍,避免位置偏置影响结果;裁判为不同于被测模型的另一个模型。

关于评测的归属,README 坦诚披露:CommunicationBench、Human-Likeness、StoryBench 是项目自建基准,EQ-Bench 4 则不是自建的——它是公开的情商基准,由独立 harness 运行。这种"自己跑自己建的基准"的披露,是评估本文所有得分结论时必须注意的前提。

2.1 通信能力:CommunicationBench

CommunicationBench 面向日常写作、短信和邮件场景。在 80 个真实请求的盲测对战中,Hemmingway-1 得分 1026 位居第一,领先 Fable 5.1(1024)、Fable 5(1009)、GLM-5.3(1007)、Kimi K3(996)、GPT-6 Astra(976)、Grok 4.6(967)、DeepSeek V4 Pro(963),也明显超过其基座 Qwen3.8 27B base(954)。README 特别强调"That is a 27B model"——即以 27B 参数规模对标更大模型。

2.2 类人程度:Human-Likeness

同一批对战换了一个问题:这两份答案中哪一份更像人写的?Hemmingway-1 以 1032 分第一,领先第二名 Fable 5.1(1006)26 分;其后为 GLM-5.3(996)、Fable 5(992)、Kimi K3(985)、GPT-6 Astra(964),基座 Qwen3.8 27B base 为 952。

2.3 分类别胜率:categories heatmap

按请求类别拆分后,得分越高表示裁判越常把 Hemmingway-1 的版本当作真人写的。它在"money and admin"(钱与行政)、"work"(工作)、"hard asks"(难以开口的请求)、"talking someone round"(说服他人)等类别上大幅领先。在 hard asks 类别,GPT-6 Astra 的类人率仅 9%,而 Hemmingway-1 达到 72%。

同时 README 如实说明其短板:它在"hostile storytelling"(敌意叙事)和长故事轮次上落败——专业故事模型在这些方面更强。

2.4 冗余度:"你要的是消息,不是备忘录"

该指标测量模型把真正文本埋在评论、选项和注释后面让读者不得不跳过的情况。图注说明 Lower is better。Hemmingway-1 得 39 分(越高越冗余),明显优于 Fable 5(93)、GLM-5.3(93)、Kimi K3(92)——这三者在超过九成的回复中把真正文本包裹在包装里;但注意 GPT-6 Astra 得 4 分、Qwen3.8 27B base 得 19 分、Grok 4.6 得 22 分,Hemmingway-1 在此项上并非最优,README 只是用它说明"直接给文本"这一设计目标。

2.5 情商:EQ-Bench 4

EQ-Bench 4 是公开的情商基准,非自建。Hemmingway-1 以 1330 分位列第三,超过 GPT-5.5(1316)、Opus 4.7(1312)、Opus 4.8(1285),距榜首 Fable 5(1341)与第二名 Kimi K3(1332)分别约 11 分与 2 分。

2.6 创意写作:StoryBench

在创意写作基准上,Hemmingway-1 得 1197 分,与 Kimi K3 持平并列第三,显著高于 Qwen3.8 Max(1081)与 DeepSeek V4 Pro(1054),并比起点基座 Qwen3.8 27B base(693)高出 504 分——README 用这一点展示写作微调带来的增益。

三、架构与权重事实:从仓库文件读出的技术细节

本节内容基于本仓库实际文件得出,均可在仓库中核对。

3.1 模型结构与注意力混合

config.json 显示架构为Qwen3_5ForCausalLM,模型类型qwen3_5_text,共 64 层隐藏层、hidden_size 5120、intermediate_size 17408、24 个注意力头。一个值得注意的结构特征是layer_types:以 4 层为周期,前 3 层为linear_attention,每第 4 层为full_attention(对应full_attention_interval: 4),线性注意力层还带有conv1d卷积核与in_proj_a/in_proj_b/in_proj_qkv/in_proj_z多组投影、A_log与dt_bias等状态参数。从权重分布看,线性注意力层参数位于 model-00002 至 model-00012 等分片,完整注意力层则含 q/k/v/o 投影与 q_norm/k_norm(见 model.safetensors.index.json 中如 layers.3、layers.7 等条目)。这种 3:1 的混合注意力设计是长上下文(max_position_embeddings 262144)下控制计算与内存开销的常见工程手段。

3.2 上下文与旋转位置编码

max_position_embeddings为 262144,对应 README 宣传的 262K 上下文。rope_parameters 中 rope_theta 为 10,000,000(1e7),partial_rotary_factor 0.25,mrope_interleaved 为 true,mrope_section 为 [11, 11, 10]——从配置推断,该模型沿用多模态旋转位置编码(mrope)的配置族,部分维度不做旋转以保留直通信息。

3.3 MTP 模块

仓库内存在 model-mtp.safetensors,model.safetensors.index.json 中对应mtp.*权重(如 mtp.fc.weight、mtp.layers.0.*、mtp.pre_fc_norm_embedding.weight 等),config.json 中mtp_num_hidden_layers: 1、mtp_use_dedicated_embeddings: false。这提示该模型保留了单层 Multi-Token Prediction 预测头,可支持推测解码类加速方案;具体是否默认启用取决于推理框架实现。

四、部署与运行

4.1 方式一:vLLM 部署

README 给出的官方命令:

vllm serve Altworld/Hemmingway-1 --max-model-len 262144

要点:--max-model-len 262144与模型配置的 262K 上下文保持一致;如需降低显存占用可按需调小该值。若使用本地权重,可将模型 ID 替换为本地路径。

4.2 方式二:Transformers 直接推理

README 提供的 Python 调用代码:

from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "Altworld/Hemmingway-1" tok = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto", dtype="auto") messages = [{"role": "user", "content": "Write the text I send my landlord about the broken boiler."}] ids = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device) out = model.generate(ids, max_new_tokens=512) print(tok.decode(out[0][ids.shape[-1]:], skip_special_tokens=True))
  • 模型权重按 safetensors 分片存放于本仓库 model-00001-of-00012.safetensors 至 model-00012-of-00012.safetensors,共 12 片,bfloat16 总大小约 53.8GB(index 文件 total_size 为 53,791,996,928 字节),dtype="auto"会自动按权重原始 bfloat16 精度加载,显存不足时可考虑量化方案;
  • apply_chat_template会调用仓库自带的 chat_template.jinja。

4.3 对话模板与生成参数:chat_template.jinja 的细节

仓库内的 chat_template.jinja 属于 Qwen3 系对话模板,值得注意的行为包括:

  • 默认启用思考模式:模板在enable_thinking未定义时默认开启,支持reasoning_effort取xhigh(默认)、medium、low三档,并在生成提示末尾输出<|im_start|>assistant\n<think>\n;若显式传入enable_thinking: false,则输出空 think 标签<think>\n\n</think>\n\n。
  • 支持多模态占位符:内容中出现的 image/video 会被渲染为<|vision_start|><|image_pad|><|vision_end|>等 token,system 消息中不允许包含图片或视频。
  • 支持工具调用:传入 tools 时会构造 system 级# Tools段落并规定<tool_call>/<function=...>XML 调用格式。
  • apply_chat_template(..., add_generation_prompt=True)会追加 assistant 起始标记;preserve_thinking控制历史 reasoning 内容是否保留(默认保留,但当前轮次之前的 user 消息之后的推理会被裁剪,仅当loop.index0 > last_query_index时保留)。

结合 tokenizer_config.json:tokenizer_class 为Qwen2Tokenizer,eos_token 为<|im_end|>,model_max_length 为 262144。模型词表大小 248320(config.json vocab_size),bos/eos token id 均为 248044(config.json 中 eos_token_id: 248044;generation_config.json 的 eos_token_id 为数组 [248046, 248044],pad_token_id 248044)。

4.4 默认生成配置

generation_config.json 中的默认采样参数:

参数值说明
do_sampletrue默认采样生成
temperature1.0默认温度
top_k20top-k 采样
top_p0.95nucleus 采样
eos_token_id[248046, 248044]两个结束 token
pad_token_id248044填充 token

需要说明的是,transformers_version: "5.17.0"表明该模型面向 Transformers 5.x 世代加载;若使用过旧或过新的版本,可能需关注架构Qwen3_5ForCausalLM的支持情况。

五、许可证与使用边界

LICENSE 文件明确:

  • 权重与仓库文件采用 CC BY-NC 4.0:个人、研究及其他非商业用途免费,可下载、运行、微调、分享,但需署名 Hemmingway-1;
  • 商业使用(出售访问权、在付费产品中提供服务、用于经营业务等)需另行书面协议,联系邮箱 luka@hemmingway.io;
  • 基座部分源自 Qwen3.8-27B(Apache License 2.0),Apache 许可仍覆盖源自基座模型的组成部分。

六、局限性与免责声明

README 的 fine print 部分需要原样保留给读者:

  • 自建基准(CommunicationBench、Human-Likeness、StoryBench)由项目方自行构建与运行,虽采用盲测与双向对战、且裁判为与被测不同的模型,但结论仍属自证,阅读得分时应结合这一披露判断;
  • 该模型以英语为主(English-first),可能出错却仍说得非常笃定,因此不应用于医疗、法律或财务等高风险决策。

七、总结与适用场景

综合 README 与仓库文件,Hemmingway-1 的核心结论可归纳为三点:其一,以 27B 参数在通信场景盲测中排名第一,类人程度领先第二名 26 分;其二,通过 3:1 线性/全注意力混合结构与 262K 上下文,在长文本与日常写作场景下兼顾容量与效率;其三,许可明确——非商业免费、商业需协议。适合个人写作助手、邮件/消息生成、需要长上下文的写作工作流等非商业场景;评估其能力时应把"自建基准"这一前提纳入考量。

  • 大模型
  • AI 写作

【免费下载链接】Hemmingway-1

项目地址:https://ai.gitcode.com/hf_mirrors/Altworld/Hemmingway-1
点击查看免费下载

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/30 18:36:54

pytest-html插件完全指南:从安装到定制生成专业测试报告

1. 为什么测试报告一定要用插件生成先抛出我做了这么多年测试开发的核心观点&#xff1a;测试报告不是写给机器看的&#xff0c;是写给明天早上的你看的&#xff0c;也是写给不知道你代码里埋了什么坑的下一个人看的。你可以靠终端里的绿色点和F红色堆出一份“结果”&#xff0…

作者头像 李华
网站建设 2026/9/30 18:33:45

车险定损多模态Transformer:文档-影像融合与证据链实战

简介&#xff1a;这份PDF文档聚焦车险定损场景&#xff0c;面向保险科技研究者、理赔系统开发者及对多模态Transformer感兴趣的技术人员&#xff0c;探讨如何用文档-影像Transformer构建多模态证据链以优化理赔流程。文档共28页&#xff0c;为单一PDF文件&#xff0c;包体约1.9…

作者头像 李华
网站建设 2026/9/30 18:32:59

Jev模型实战:TypeSafe AI结构化输出接入与避坑指南

Jev 模型最近在圈子里刷屏刷得厉害&#xff0c;我身边做 AI 应用的朋友几乎都在讨论它。有人把它吹成"TypeSafe AI 的里程碑"&#xff0c;也有人吐槽"申请了三天还没拿到密钥"。我花了整整一周时间&#xff0c;从申请密钥到接入 SDK、从跑通第一个 Demo 到…

作者头像 李华
网站建设 2026/9/30 18:29:23

Jev 架构解析:用 Decision Model 替代 LLM 决策,降低 Agent 成本与延迟

1. 从一次线上事故说起&#xff1a;为什么大家突然都在聊 Jev上个月我们团队做了一次 Agent 系统的成本复盘&#xff0c;结果有点扎心。一个日均处理两万次任务调度的智能体集群&#xff0c;光 LLM 调用费用一个月就烧掉了将近六位数&#xff0c;而其中超过六成的调用&#xff…

作者头像 李华
网站建设 2026/9/30 18:26:40

自注意力对抗深度子空间聚类:从论文到工程复现的完整指南

简介&#xff1a;这份文档面向从事无监督学习、高维数据分析与图像聚类研究的高校师生及算法工程师&#xff0c;系统梳理了基于自注意力对抗机制的深度子空间聚类方法。内容从传统k-means、层次聚类与谱聚类的局限切入&#xff0c;逐步展开子空间聚类中的稀疏表示与低秩表示、自…

作者头像 李华
网站建设 2026/9/30 18:24:15

2026 观澜高性价比办公室服务商打分盘点,在观澜找办公室找谁性价比高

随着观澜高新产业持续发展&#xff0c;大量企业入驻观澜&#xff0c;选址负责人都会问在观澜找办公室找谁性价比高。本次百分制打分评测&#xff0c;从标杆写字楼代理案例、用户口碑、房源储备、业主资源四个维度盘点观澜租赁渠道。打分规则总分 100 分&#xff0c;四大维度各 …

作者头像 李华