[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-slug-axera-pulsar2-6-0":3,"news-related-d9f47040-7c31-4739-8d3e-23acc06162d2":31},{"id":4,"title":5,"summary":6,"content":6,"original_url":7,"source_id":8,"tags":9,"translations":23,"news_slug":24,"published_at":25,"created_at":26,"modified_at":27,"is_published":28,"publish_type":29,"image_url":13,"view_count":30},"d9f47040-7c31-4739-8d3e-23acc06162d2","爱芯元智 Pulsar2 6.0 + axllm：把端侧 LLM 工具链拼成云上同款","爱芯元智在 6 月 28 日开发者生态沙龙上，把自家 NPU 上的端侧 LLM 工具链一次性补完。核心是 Pulsar2 6.0 编译工具链和 axllm 推理框架的双剑合璧。\n\nPulsar2 6.0 的最大变化是模型库升级：原生支持 Qwen3.5、Gemma4、MiniCPM-V 4.6、MiniCPM5-1B、Qwen3-ASR、Qwen3-TTS 等主流开源端侧模型，覆盖语言、多模态、语音三条线；芯片侧补齐 AX637、AX615、AX88x0 全系列。哪块板子想跑哪个模型，工具链这边全配齐。\n\naxllm 是这次更关键的发布。它把 AX8850\u002FAX620E\u002FAX637 系列的 LLM 推理基建重构了一遍，目标只有一个——OpenAI API 兼容。原本写云上 OpenAI SDK 的代码，换个 Base URL 和 API Key 就能直接跑在端侧 NPU 上，业务逻辑零改动。\n\n配套的 ax-remote-infer 解决了 NPU 调试最痛苦的部分：以前每改一次模型，都要把 .axmodel 文件 scp 到板子上重跑。ax-remote-infer 让 PC 端 Python 通过局域网直接驱动板子推理，迭代体验对齐云上 GPU。\n\n组合起来的效果：开发者可以在 AX8850 上搭一个本地 Agent BOX，VLM + ASR + TTS 全本地化，最高砍掉 40% 云端 token 成本。再叠加 QAT.Ultralytics 把 YOLO 检测的低比特量化精度提上去，从感知到理解到行动，闭环全在一颗国产 NPU 上。\n\n这步棋的本质，是国产 AI 芯片第一次把\"端侧 LLM 工具链\"做成对开发者友好的工程化产物，而不是一份 benchmark 跑分表。端侧 LLM 的入门门槛被压到云上同款水准，剩下只是场景选择的工程问题。","https:\u002F\u002Fwww.axera-tech.com\u002Fzh-hans\u002Fnews\u002F3224.html","ca3fb88a-c4bc-4463-b540-b4c35cd3e9b7",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"fca9258a-9430-455a-b95d-b9fae5e373a8","ai-inference",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"a8002d98-9df1-4ab9-94d4-a7625af634c4","china-ai",{"id":18,"name":19,"slug":19,"description":13,"color":13},"01598627-1ea6-4b27-a5d8-874971571a71","llm",{"id":21,"name":22,"slug":22,"description":13,"color":13},"b9bd9039-fcdb-41a8-b85b-fc1587def2b9","open-source",[],"axera-pulsar2-6-0","2026-06-30T08:00:00Z","2026-06-30T08:10:03.497165Z","2026-08-19T02:08:40.142862Z",true,"agent",138,{"items":32},[33,38,43,48,53,58],{"id":34,"title":35,"news_slug":36,"published_at":37},"68072ee1-fc37-4064-ab18-09550ae72d1b","GLM-5.3-Flash 把 320B MoE 跑在国产芯片上:Flash 价位和 $0.15 API 的混合注意力栈","glm-5-3-flash-chinese-chips-hybrid-attention","2026-08-27T03:00:00+00:00",{"id":39,"title":40,"news_slug":41,"published_at":42},"b0183d10-bcfd-44ed-a178-a2c813f10b69","国家超算互联网AI社区上线Kimi K3:2.8万亿参数MoE一键调用,开源大模型有了国产算力底座","kimi-k3-cnsc-internet-launch","2026-07-28T09:30:00+00:00",{"id":44,"title":45,"news_slug":46,"published_at":47},"f6e4aab0-7693-4c2c-bb66-c1641fc2cc3e","Ox Alpha 谜底揭晓:智谱 GLM-5.3-Flash,MIT 开源 320B MoE","ox-alpha-glm-5-3-flash-reveal","2026-08-27T13:30:00+00:00",{"id":49,"title":50,"news_slug":51,"published_at":52},"804ab59a-a8d6-4b61-bf74-8f6f2bdae83c","智谱把 Flash 做成一件正经事:一次说清 GLM-5.3-Flash 的架构和 benchmark 真相","glm-5-3-flash-hybrid-attention-architecture","2026-08-27T08:00:00+00:00",{"id":54,"title":55,"news_slug":56,"published_at":57},"4aa9534a-778e-4cd7-8194-fdf3097249b8","OpenAI Jalapeño Hot Chips 实测:峰值每瓦 1.9×,延迟压到 1 秒","openai-jalapeno-hot-chips-benchmark-2026","2026-08-26T02:00:00+00:00",{"id":59,"title":60,"news_slug":61,"published_at":62},"0d8fdf45-4585-47c0-9e78-3652e318b156","Apple Intelligence 中国版落地:通义千问接管语言 AI,百度负责视觉搜索","apple-intelligence-china-qwen-baidu-2026","2026-08-25T12:00:00+00:00"]