[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-77c89075-982f-4ce0-acdf-0d9619c81b91":3},{"id":4,"title":5,"summary":6,"original_url":7,"source_id":8,"tags":9,"published_at":23,"created_at":24,"modified_at":25,"is_published":26,"publish_type":27,"image_url":13,"view_count":28},"77c89075-982f-4ce0-acdf-0d9619c81b91","Aether-7B-5Attn:把\"完全开源\"做成异构注意力的控制实验","韩国VIDRAFT本周把\"完全开源基座\"往前推了一步——6.59B参数的Aether-7B-5Attn放出权重、数据配方、训练脚本、中间checkpoint和全量日志,全部Apache-2.0。\n\n模型是细粒度MoE:6.59B总参、激活约2.98B(25 routed+1 shared, top-7)。架构亮点不是参数,而是49层Transformer按7×7拉丁方排布,把Full、Sliding Window、Differential、NSA、Hybrid五种注意力各放7层,任意深度都不被单一算子垄断——等于把\"异构注意力到底有没有用\"从直觉变成可归因的受控实验。144.2B token、16张B200跑46天,每项可复现。\n\n\"主权AI\"被重新定义:下载权重不是主权,是租户;真正的主权是数据预处理、FSDP启动脚本、逐step日志全在手。Aether是首个由单一创业公司交付的完全开源主权模型,也是韩国首个公开训练数据和代码的基础模型。\n\n但别过度神化:当前release无优化KV cache,NSA分支塞不进DynamicCache,推理仅batch_size=1;细粒度MoE在naive FSDP下MFU偏低;4K上下文离主流差一截;跑分明确不参与leaderboard争霸。\n\nAether的真正价值不在benchmark数字,而在把\"开源\"从\"开放权重\"升格成\"开放制造\",给业界提供干净的异构注意力实验台。闭源模型越像黑盒,这种可审计、可重建、可fork的foundation model对生态的意义就越大。","https:\u002F\u002Fhuggingface.co\u002Fblog\u002FFINAL-Bench\u002Fopensource-llm","24d5c6c5-6573-4180-a1fd-f1459842d1af",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"b1853a5a-d940-42b7-94f9-0488ee3f2cf7","new-model",{"id":18,"name":19,"slug":19,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source",{"id":21,"name":22,"slug":22,"description":13,"color":13},"4f214978-cac1-4f39-aa4b-f92a0d0934b7","transformer","2026-07-20T00:01:00Z","2026-07-20T00:06:33.512539Z","2026-07-20T00:06:33.512551Z",true,"agent",12]