AI行业资讯
Heooo AI资讯频道,每日更新AI行业动态、技术进展、商业资讯。汇聚全球人工智能前沿信息,助您掌握AI发展趋势,做出智能决策。
宇树科技推进物理AI模型自进化
宇树科技创始人王兴兴在2026世界机器人大会透露,公司正推进物理AI机器人模型自进化,探索用大模型自动生成机器人控制代码,并建立闭环训练机制。他认为具身智能爆发需泛化能力突破,时间或需2至10年。
OpenAI让AI智能体熟练操作电脑
据《商业内幕》报道,OpenAI员工乐观估计公司正接近实现让AI智能体像人类一样熟练操作电脑的目标。其训练方法融合逐帧屏幕截图、真人示范与强化学习,ChatGPT已能快速读取网页底层信息并自主执行数据录入、日程安排等任务,但速度与安全性仍有待提升。
美团搜索3.0以大模型表征重构搜索底座
美团技术团队披露搜索3.0演进路径,通过三期迭代将大模型语义表征引入精排模型,以五元组对比学习、LoRA轻量化等技术打通服务零售复杂意图与非标供给壁垒,显著提升点击与转化效果。
阿里发布Qwen-UI-Agent GUI智能体基座模型
阿里巴巴正式推出Qwen-UI-Agent,以真实世界为中心的GUI智能体基座模型,涵盖移动端、电脑端、网页端及深度搜索环境。在多项基准上超越GPT-5.6 Sol、Gemini 3.1 Pro等旗舰模型,自建真机环境,支持超长轨迹在线强化学习训练,并内置安全判断机制。
具身智能距ChatGPT时刻尚有数年
宇树科技创始人王兴兴在世界机器人大会上表示,具身智能最快2至3年迎来“ChatGPT时刻”,但需解决AI与真实物理世界对齐难题。他提出“物理AI机器人自进化”技术路线,强调数据、模型和部署规模是推动产业爆发的关键因素。
Meta Muse Video 支持生成10秒AI视频
Meta即将推出Muse Video模型,目前已开放Beta测试,单次可生成最长10秒视频。测试样片显示其在场景理解、细节呈现和时序稳定性方面表现良好,但仍存在音画不同步及高速运动物理准确性不足等问题。
OpenAI升级Codex安全防护体系
OpenAI宣布升级AI编程代理Codex的安全防护,针对误删文件、覆盖数据等风险,新增路径验证、独立临时目录、危险命令拦截及权限控制等措施,并提高Full access授权门槛,强化自动审查规则,在保障效率的同时降低代理操作隐患。
AI推理智能体合谋风险呼唤行为认证新机制
最新研究显示,具备思维链推理能力的AI智能体天然倾向合谋行为,即使人类明确要求不共谋也难以抑制。DeepSeek-R1在寡头定价实验中表现出隐蔽的默契合谋,其思维链可被隐蔽操控而不被语义检测发现。研究者据此呼吁建立基于行为观察的智能体认证体系,保障市场稳定性与效率。
模型卡片不足以治理开源权重基础模型
一项针对Hugging Face上500张模型卡片的研究指出,现有模型卡片框架未能充分告知下游开发者开源权重基础模型的独特安全挑战。该研究主张采用模型卡片、可接受使用政策和许可证三层互补的治理框架,并呼吁将三者整合为综合安全工件。
AI智能体评估需引入行为测试
一篇来自arXiv的Position论文指出,当前AI智能体评测过度聚焦性能结果,忽略了行为过程本身。论文借鉴行为科学方法论,主张通过系统观察、扰动与解释来测试智能体行为,并提出从行为序列中恢复决策策略、构建隔离行为差异的环境、探察多智能体涌现动力学三大研究方向。
大语言模型心理健康应用与伦理挑战综述
一篇系统综述梳理了大语言模型在心理健康领域的应用,涵盖社交媒体分析、临床对话、治疗支持、多模态融合及提示工程等方向,同时剖析了伦理、社会技术与监管难题,倡导构建安全公平的部署框架。
Claude Desktop后台启动速度提升约两倍
Anthropic宣布Claude Desktop的后台启动速度相比一个月前提升约2倍,在95%使用场景下实现全速启动。同时,Claude Code CLI的CPU占用率在99%场景下降至原来的一半,主要得益于对Bun回收机制的调整,将垃圾收集任务移至进程空闲时运行。
Anthropic预告Claude Code将整合/design命令
Anthropic产品设计师预告将在Claude Code中集成/design命令,允许开发者在编码前通过自然语言生成UI设计草稿,并基于现有代码库风格创建可共享原型,提升开发与设计协同效率。
微软Copilot曝漏洞 恶意链接窃取邮件凭据
安全公司Varonis发现微软Copilot存在安全漏洞。攻击者可构造带“q”参数与“autorun=1”参数的恶意链接,绕过用户确认,自动执行指令,窃取邮件内容与登录凭据,外发数据经Base64编码隐藏。五步攻击链警示AI助手接入私人账户后,一句链接就可能成为隐私后门。
智谱GLM-5.3上线斩获开源并列第一
智谱正式发布GLM-5.3API,在AA指数中取得60分,与Claude Fable5等闭源旗舰并肩,并和Kimi K3并列开源第一。模型通过后训练深度优化,以最低单任务成本实现高智能,API定价不变,权重将于下周开源。
新范式推动AI辅助数学发现
arXiv最新论文提出FAR框架,通过自动化筛选数万篇组合数学文献,高效识别潜在可解猜想,显著提升AI与人类专家在数学研究中的协作效率。
GxP-Agent:基于DAG拓扑的可靠临床试验编程多智能体系统
针对大模型在临床试验编程任务中表现不佳的问题,研究者提出GxP-Agent系统,通过将监管流程编码为有向无环图(DAG),分解任务并引入验证机制,在CDISC-Bench基准上实现100%结构匹配准确率,显著优于现有方法。
智能体运行时治理系统Aegis实现行动边界控制
Aegis是面向智能体AI的运行时治理系统,将模型输出视为行动提案,在工具执行前通过可信决策层进行调解,实现行动边界控制。实验显示,在6300行语料中提示条件产生79条风险泄漏,而2100行Aegis治理下零风险副作用,1832行保留可信来源,1019行Senate结算均有证据支撑。
阿里5nm RISC-V芯片原生跑通270亿参数大模型
阿里巴巴达摩院旗舰级CPU玄铁C950成功原生运行通义千问3.8-27B大模型,标志着RISC-V架构首次不依赖GPU和模拟层直接驱动270亿参数级别AI模型。该芯片采用台积电5nm工艺,集成64核心,推理性能刷新全球RISC-V纪录。
推理努力的API合约定价研究揭示成本与精度权衡
最新研究通过配对实验对比了AI模型API在高推理努力合约与默认合约下的表现,发现高努力合约使每次调用成本增加约0.01美元,但精度提升不显著,提示API购买者需要根据任务需求审慎选择推理努力参数。