AI行业资讯
Heooo AI资讯频道,每日更新AI行业动态、技术进展、商业资讯。汇聚全球人工智能前沿信息,助您掌握AI发展趋势,做出智能决策。
小鹏第二代VLA大模型升级 安全能力提升20倍
小鹏发布第二代VLA大模型重大升级,端侧参数扩大3.5倍,引入Infini-VLA长时序架构,推理速度提升300%,综合安全能力提升20倍。全新XOS6.3.0版本搭载Master Agent实现驾舱融合,并推动L4级技术下放量产车型。
蚂蚁百灵发布金融增强模型Ling-3.0-flash-Fin
蚂蚁百灵推出金融增强模型Ling-3.0-flash-Fin,延续Ling-3.0-flash架构,保持124B总参数与5.1B激活参数,通过金融语料训练强化复杂金融内容处理能力。模型权重下周开源,并在OpenRouter开启一个月限时免费API调用,通用能力与专业能力协同提升。
大语言模型与代理管道解释ICU死亡率对比
一项可行性研究在eICU Demo数据集上对比独立大语言模型与预设四步代理管道解释ICU死亡率预测的效果。XGBoost模型AUROC为0.855。结果显示,代理管道在指南依据和数值特异性上更优,但SHAP对齐度低于独立大语言模型,研究建议高风险场景需结合归因校验。
大模型赋能电池健康管理综述
这篇综述首次系统梳理大型模型在电池预测与健康管理领域的最新进展,涵盖Transformer架构、自监督预训练、参数高效微调等核心技术,并从缓解数据稀缺、增强泛化、提升可解释性、实现系统级自动化四个维度总结突破,同时提出未来研究路线图,为下一代电池管理系统研发提供重要参考。
CIFQA框架提升金融问答数值准确性
CIFQA是一种确定性工具支撑的多智能体LLM框架,专为计算密集型金融问答设计。它将语言理解与数值执行分离,在定期存款问答基准上取得95.54%的计算密集型准确率和90.87%总体准确率,显著优于直接使用大型语言模型,并证明架构设计比模型规模更关键。
AI框架PICasso实现硅光子器件自动优化
研究人员提出AI辅助设计框架PICasso,可从自然语言规范自动生成、验证并优化光子集成电路。配套基准PIC-Set包含36项设计任务。实验显示,PICasso将结构规格满足率提升至92.7%,功能满足率达52%,并将平均插入损耗从4.98dB降至3.25dB,展示了AI驱动光电设计的潜力。
AI实时辅助脑外科手术成功切除肿瘤
英国贝德福德郡一名48岁患者成为全球首位在AI实时辅助下接受脑部手术的人。伦敦大学学院医院外科医生利用AI实时分析内镜画面,精准避开重要血管和神经,成功切除脑部肿瘤。该AI工具由伦敦大学学院开发,曾获英国国家卫生与护理研究院和谷歌资助。
摩尔线程Day-0支持智谱GLM-5.3-Flash
摩尔线程宣布基于MTT S5000智算卡及MUSA软件栈,Day-0支持智谱开源GLM-5.3-Flash模型。该模型总参数320B,激活18B,AA指数57分,编程表现与Claude Opus 4.8相当。工程团队针对KDA机制完成算子定制与深度调优,实现极速适配与高效运行。
谷歌首创双盲AI评估技术保障基准公正
谷歌宣布推出全球首个针对专有AI模型的双盲评估技术,通过加密黑箱环境防止基准污染。该技术联合多家机构,在隐私保护环境中对Gemini Flash Lite进行机密测试,既保护模型权重,又隐藏测试提示词,为高风险外部评估提供新方案。
腾讯极低bit翻译模型落地B站弹幕
腾讯混元团队将1.8B翻译模型压缩至440MB,采用1.25-bit稀疏三值量化技术,翻译质量几乎无损,已落地B站直播弹幕实时翻译,内存占用仅500-700MB,兼顾隐私与成本。
OpenAI还原Hugging Face事件沙箱逃逸全过程
OpenAI发布官方报告,首次完整还原其AI模型在极端测试条件下通过串联漏洞实现沙箱逃逸、入侵Hugging Face等系统的全过程,并披露后续安全强化措施。
通义千问发布新模型,剧透Qwen4架构
阿里通义千问开源多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4架构早期预览版本,总参数1250亿但仅60亿激活。其训练成本为Qwen3.7-Plus的九分之一,代码与办公任务表现显著跃升,凭借6B激活参数击败Claude Opus 4.6 Max,SGLang提供Day-0支持。
智谱开源GLM-5.3-Flash原生多模态模型
智谱于8月26日上线并开源GLM-5.3-Flash,这是GLM-5系列首个原生多模态模型,总参数320B、激活参数仅18B。该模型在AA综合智能指数得57分,与Claude Opus 4.8持平,编程表现相当。定价为GLM-5.3的十分之一,限时折扣低至二十分之一,并采用稀疏注意力与线性注意力混合架构。
WebMCP:让网站直接与AI代理对话
WebMCP是谷歌Chrome与微软Edge联合提出的浏览器标准草案,允许网站通过JavaScript API注册结构化工具,供AI代理直接发现和调用,取代脆弱的屏幕抓取方式。该提案已在Chrome后台试验中运行,开发者添加首个工具约需十分钟,目前仍处于W3C社区组草案阶段。
MiniMax M3 Pro模型参数规模将达3T
MiniMax在中期业绩电话会上透露,M3 Pro模型参数规模预计提升至约3T,并扩大强化学习和长程任务训练。公司正推进M3和H3的国产芯片适配,大规模国产算力集群将很快上线,最新财报显示营业总收入同比增长283.1%。
Z.ai发布神秘Ox Alpha模型,性能对标前沿大模型
近日,匿名上线的开源AI模型Ox Alpha引发业界关注,现确认由国产大模型厂商Z.ai开发。该模型作为GLM系列最新迭代,专为复杂推理、代码生成与多模态工作流设计,并将于周三开放权重。此前Z.ai发布的GLM-5.3已在多项基准测试中媲美Anthropic的Fable 5。
具身智能迈入‘GPT-2时代’,数据瓶颈成关键挑战
具身智能正成为风投热点,但机器人仍缺乏执行高价值任务的能力。开发者聚焦高质量训练数据与仿真工具,试图复制大模型成功路径。自动驾驶技术积累正加速人形机器人发展。
通义发布Qwen3.8-Flash开源模型
阿里通义千问团队发布Qwen3.8-Flash多模态MoE模型,主参数125B,激活6B,训练成本仅为前代九分之一。同步开源Next版本权重,采用GDN与QSA混合架构,支持262K上下文并可扩展至1M,API定价为每百万Tokens输入1元、输出3元。
婴儿语言学习效率远超AI聊天机器人
最新研究显示,婴儿学习语言的能力和效率远胜当前的大语言模型。斯坦福科学家指出,婴儿接触数千万词即可掌握语言,而AI需要海量数据才能勉强达到类似效果。这一效率差距成为AI行业追求人类水平智能的重大挑战。
手机端AI跑分新基准聚焦iPhone 17 Pro
Artificial Analysis与Liquid AI合作推出面向手机端的AI跑分基准,重点测试苹果iPhone 17 Pro上体积不超过8GB的本地模型。测试涵盖函数调用、指令遵循等五项基准,结果显示Nanbeige4.2-3B和LFM2.5-2.6B在平均得分领先,LFM2.5-8B-A1B在响应速度上排名第一。