韩国VIDRAFT本周把"完全开源基座"往前推了一步——6.59B参数的Aether-7B-5Attn放出权重、数据配方、训练脚本、中间checkpoint和全量日志,全部Apache-2.0。 模型是细粒度MoE:6.59B总参、激活约2.98B(25 routed+1 shared, top-7)。架构亮点不是参数,而是49层Transformer按7×7拉丁方排布,把Full、Sliding Window、Differential、NSA、Hybrid五种注意力各放7层,任意深度都不被单一算子垄断——等于把"异构注意力到底有没有用"从直觉变成可归因的受控实验。144.2B token、16张B200跑46天,每项可复现。 "主权AI"被重新定义:下载权重不是主权,是租户;真正的主权是数据预处理、FSDP启动脚本、逐step日志全在手。Aether是首个由单一创业公司交付的完全开源主权模型,也是韩国首个公开训练数据和代码的基础模型。 但别过度神化:当前release无优化KV cache,NSA分支塞不进DynamicCache,推理仅batch_size=1;细粒度MoE在naive FSDP下MFU偏低;4K上下文离主流差一截;跑分明确不参与leaderboard争霸。 Aether的真正价值不在benchmark数字,而在把"开源"从"开放权重"升格成"开放制造",给业界提供干净的异构注意力实验台。闭源模型越像黑盒,这种可审计、可重建、可fork的foundation model对生态的意义就越大。