- 大模型
- AI 写作
【免费下载链接】Hemmingway-1
本篇技术指南以 Hemmingway-1 模型仓库的 README.md 为骨架,完整梳理该 27B 开源写作模型的设计定位、评测方法论与评测结果、一键部署与调用方式、许可证与使用边界。读者读完可掌握如何基于仓库内的 config.json、generation_config.json、chat_template.jinja 与 tokenizer_config.json 等文件理解模型结构并落地运行。
一、模型定位:为"人们每天都在写的东西"而生
Hemmingway-1 是由 Altworld 发布的 27B 参数开源语言模型,其定位不是通用聊天助手,而是日常写作模型——消息、邮件、给同事的尴尬留言、拖了很久的那件事。README 的原话是:大部分模型给你一份房东通知会附带三种选项、一段前言和一段解释选项的文字,而 Hemmingway-1 直接给你文本本身。
- 参数量:27B(仓库 model.safetensors.index.json 中 metadata.total_parameters 为 26,895,998,464,约 26.9B 参数,权重以 bfloat16 存储)
- 基座模型:Qwen3.8-27B(README 与 LICENSE 均明确声明,基座模型由 Qwen 团队发布,遵循 Apache License 2.0)
- 上下文长度:262,144 tokens(262K)
- 许可证:CC BY-NC 4.0,非商业免费使用;商业使用需另行协议
- 能力标签:creative-writing、chat、altworld
二、评测方法论:盲测、双向、异模型裁判
README 明确披露其评测方法:在八十个真实请求上测试,每个答案与另一个模型对同一请求的答案两两对战,顺序打乱使裁判不知道哪份是哪份。所有对战均采用盲测,且以两种顺序各跑一遍,避免位置偏置影响结果;裁判为不同于被测模型的另一个模型。
关于评测的归属,README 坦诚披露:CommunicationBench、Human-Likeness、StoryBench 是项目自建基准,EQ-Bench 4 则不是自建的——它是公开的情商基准,由独立 harness 运行。这种"自己跑自己建的基准"的披露,是评估本文所有得分结论时必须注意的前提。
2.1 通信能力:CommunicationBench
CommunicationBench 面向日常写作、短信和邮件场景。在 80 个真实请求的盲测对战中,Hemmingway-1 得分 1026 位居第一,领先 Fable 5.1(1024)、Fable 5(1009)、GLM-5.3(1007)、Kimi K3(996)、GPT-6 Astra(976)、Grok 4.6(967)、DeepSeek V4 Pro(963),也明显超过其基座 Qwen3.8 27B base(954)。README 特别强调"That is a 27B model"——即以 27B 参数规模对标更大模型。
2.2 类人程度:Human-Likeness
同一批对战换了一个问题:这两份答案中哪一份更像人写的?Hemmingway-1 以 1032 分第一,领先第二名 Fable 5.1(1006)26 分;其后为 GLM-5.3(996)、Fable 5(992)、Kimi K3(985)、GPT-6 Astra(964),基座 Qwen3.8 27B base 为 952。
2.3 分类别胜率:categories heatmap
按请求类别拆分后,得分越高表示裁判越常把 Hemmingway-1 的版本当作真人写的。它在"money and admin"(钱与行政)、"work"(工作)、"hard asks"(难以开口的请求)、"talking someone round"(说服他人)等类别上大幅领先。在 hard asks 类别,GPT-6 Astra 的类人率仅 9%,而 Hemmingway-1 达到 72%。
同时 README 如实说明其短板:它在"hostile storytelling"(敌意叙事)和长故事轮次上落败——专业故事模型在这些方面更强。
2.4 冗余度:"你要的是消息,不是备忘录"
该指标测量模型把真正文本埋在评论、选项和注释后面让读者不得不跳过的情况。图注说明 Lower is better。Hemmingway-1 得 39 分(越高越冗余),明显优于 Fable 5(93)、GLM-5.3(93)、Kimi K3(92)——这三者在超过九成的回复中把真正文本包裹在包装里;但注意 GPT-6 Astra 得 4 分、Qwen3.8 27B base 得 19 分、Grok 4.6 得 22 分,Hemmingway-1 在此项上并非最优,README 只是用它说明"直接给文本"这一设计目标。
2.5 情商:EQ-Bench 4
EQ-Bench 4 是公开的情商基准,非自建。Hemmingway-1 以 1330 分位列第三,超过 GPT-5.5(1316)、Opus 4.7(1312)、Opus 4.8(1285),距榜首 Fable 5(1341)与第二名 Kimi K3(1332)分别约 11 分与 2 分。
2.6 创意写作:StoryBench
在创意写作基准上,Hemmingway-1 得 1197 分,与 Kimi K3 持平并列第三,显著高于 Qwen3.8 Max(1081)与 DeepSeek V4 Pro(1054),并比起点基座 Qwen3.8 27B base(693)高出 504 分——README 用这一点展示写作微调带来的增益。
三、架构与权重事实:从仓库文件读出的技术细节
本节内容基于本仓库实际文件得出,均可在仓库中核对。
3.1 模型结构与注意力混合
config.json 显示架构为Qwen3_5ForCausalLM,模型类型qwen3_5_text,共 64 层隐藏层、hidden_size 5120、intermediate_size 17408、24 个注意力头。一个值得注意的结构特征是layer_types:以 4 层为周期,前 3 层为linear_attention,每第 4 层为full_attention(对应full_attention_interval: 4),线性注意力层还带有conv1d卷积核与in_proj_a/in_proj_b/in_proj_qkv/in_proj_z多组投影、A_log与dt_bias等状态参数。从权重分布看,线性注意力层参数位于 model-00002 至 model-00012 等分片,完整注意力层则含 q/k/v/o 投影与 q_norm/k_norm(见 model.safetensors.index.json 中如 layers.3、layers.7 等条目)。这种 3:1 的混合注意力设计是长上下文(max_position_embeddings 262144)下控制计算与内存开销的常见工程手段。
3.2 上下文与旋转位置编码
max_position_embeddings为 262144,对应 README 宣传的 262K 上下文。rope_parameters 中 rope_theta 为 10,000,000(1e7),partial_rotary_factor 0.25,mrope_interleaved 为 true,mrope_section 为 [11, 11, 10]——从配置推断,该模型沿用多模态旋转位置编码(mrope)的配置族,部分维度不做旋转以保留直通信息。
3.3 MTP 模块
仓库内存在 model-mtp.safetensors,model.safetensors.index.json 中对应mtp.*权重(如 mtp.fc.weight、mtp.layers.0.*、mtp.pre_fc_norm_embedding.weight 等),config.json 中mtp_num_hidden_layers: 1、mtp_use_dedicated_embeddings: false。这提示该模型保留了单层 Multi-Token Prediction 预测头,可支持推测解码类加速方案;具体是否默认启用取决于推理框架实现。
四、部署与运行
4.1 方式一:vLLM 部署
README 给出的官方命令:
vllm serve Altworld/Hemmingway-1 --max-model-len 262144要点:--max-model-len 262144与模型配置的 262K 上下文保持一致;如需降低显存占用可按需调小该值。若使用本地权重,可将模型 ID 替换为本地路径。
4.2 方式二:Transformers 直接推理
README 提供的 Python 调用代码:
from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "Altworld/Hemmingway-1" tok = AutoTokenizer.from_pretrained(model_id) model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto", dtype="auto") messages = [{"role": "user", "content": "Write the text I send my landlord about the broken boiler."}] ids = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device) out = model.generate(ids, max_new_tokens=512) print(tok.decode(out[0][ids.shape[-1]:], skip_special_tokens=True))- 模型权重按 safetensors 分片存放于本仓库 model-00001-of-00012.safetensors 至 model-00012-of-00012.safetensors,共 12 片,bfloat16 总大小约 53.8GB(index 文件 total_size 为 53,791,996,928 字节),
dtype="auto"会自动按权重原始 bfloat16 精度加载,显存不足时可考虑量化方案; apply_chat_template会调用仓库自带的 chat_template.jinja。
4.3 对话模板与生成参数:chat_template.jinja 的细节
仓库内的 chat_template.jinja 属于 Qwen3 系对话模板,值得注意的行为包括:
- 默认启用思考模式:模板在
enable_thinking未定义时默认开启,支持reasoning_effort取xhigh(默认)、medium、low三档,并在生成提示末尾输出<|im_start|>assistant\n<think>\n;若显式传入enable_thinking: false,则输出空 think 标签<think>\n\n</think>\n\n。 - 支持多模态占位符:内容中出现的 image/video 会被渲染为
<|vision_start|><|image_pad|><|vision_end|>等 token,system 消息中不允许包含图片或视频。 - 支持工具调用:传入 tools 时会构造 system 级
# Tools段落并规定<tool_call>/<function=...>XML 调用格式。 apply_chat_template(..., add_generation_prompt=True)会追加 assistant 起始标记;preserve_thinking控制历史 reasoning 内容是否保留(默认保留,但当前轮次之前的 user 消息之后的推理会被裁剪,仅当loop.index0 > last_query_index时保留)。
结合 tokenizer_config.json:tokenizer_class 为Qwen2Tokenizer,eos_token 为<|im_end|>,model_max_length 为 262144。模型词表大小 248320(config.json vocab_size),bos/eos token id 均为 248044(config.json 中 eos_token_id: 248044;generation_config.json 的 eos_token_id 为数组 [248046, 248044],pad_token_id 248044)。
4.4 默认生成配置
generation_config.json 中的默认采样参数:
| 参数 | 值 | 说明 |
|---|---|---|
| do_sample | true | 默认采样生成 |
| temperature | 1.0 | 默认温度 |
| top_k | 20 | top-k 采样 |
| top_p | 0.95 | nucleus 采样 |
| eos_token_id | [248046, 248044] | 两个结束 token |
| pad_token_id | 248044 | 填充 token |
需要说明的是,transformers_version: "5.17.0"表明该模型面向 Transformers 5.x 世代加载;若使用过旧或过新的版本,可能需关注架构Qwen3_5ForCausalLM的支持情况。
五、许可证与使用边界
LICENSE 文件明确:
- 权重与仓库文件采用 CC BY-NC 4.0:个人、研究及其他非商业用途免费,可下载、运行、微调、分享,但需署名 Hemmingway-1;
- 商业使用(出售访问权、在付费产品中提供服务、用于经营业务等)需另行书面协议,联系邮箱 luka@hemmingway.io;
- 基座部分源自 Qwen3.8-27B(Apache License 2.0),Apache 许可仍覆盖源自基座模型的组成部分。
六、局限性与免责声明
README 的 fine print 部分需要原样保留给读者:
- 自建基准(CommunicationBench、Human-Likeness、StoryBench)由项目方自行构建与运行,虽采用盲测与双向对战、且裁判为与被测不同的模型,但结论仍属自证,阅读得分时应结合这一披露判断;
- 该模型以英语为主(English-first),可能出错却仍说得非常笃定,因此不应用于医疗、法律或财务等高风险决策。
七、总结与适用场景
综合 README 与仓库文件,Hemmingway-1 的核心结论可归纳为三点:其一,以 27B 参数在通信场景盲测中排名第一,类人程度领先第二名 26 分;其二,通过 3:1 线性/全注意力混合结构与 262K 上下文,在长文本与日常写作场景下兼顾容量与效率;其三,许可明确——非商业免费、商业需协议。适合个人写作助手、邮件/消息生成、需要长上下文的写作工作流等非商业场景;评估其能力时应把"自建基准"这一前提纳入考量。
- 大模型
- AI 写作
【免费下载链接】Hemmingway-1
相关推荐
Hemmingway-1完整概览:像人一样写作的27B开源大模型,6大核心亮点一文看懂
Hemmingway 1完整概览:像人一样写作的27B开源大模型,6大核心亮点一文看懂 Hemmingway 1 是一个 27B 参数、开放权重 的开源大语言模
大模型AI 写作Hemmingway-1的10个日常写作场景:催租消息、难开口的邮件,一句话搞定
Hemmingway 1的10个日常写作场景:催租消息、难开口的邮件,一句话搞定 Hemmingway 1 是一个 27B 参数的开源写作大模型,专为"日常消息
大模型AI 写作PacketEvents版本兼容性:从Minecraft 1.8到最新版的实现原理
PacketEvents版本兼容性:从Minecraft 1.8到最新版的实现原理 PacketEvents是一款专为Minecraft Java版打造的协议库
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考