AI行业资讯
Heooo AI资讯频道,每日更新AI行业动态、技术进展、商业资讯。汇聚全球人工智能前沿信息,助您掌握AI发展趋势,做出智能决策。
智谱发布GLM-5.3:最强开源编程模型
智谱正式推出GLM-5.3,基于相同基座模型通过后训练Scaling显著提升性能,在多项编程与智能体基准测试中登顶开源榜首,两周内将开源模型权重。
GLM-5.3发布:后训练Scaling登顶开源编程
智谱发布GLM-5.3,基座模型不变,仅通过后训练阶段的Scaling显著提升性能。新模型在多项编程与智能体基准测试中表现亮眼,成为当前最强开源编程模型,并将在两周后开放完整权重。
DeepSeek V4 Pro编程测评夺亚,性价比惊艳
在SuperCLUE-Terminal中文编程测评中,DeepSeek-V4-Pro-0813以51.52分位列第二,仅略低于Kimi K3,但单题调用成本仅为1.42元,约为对手的十四分之一,展现出极强的性价比优势。
SSI首款推理引擎曝光主打动态学习
前OpenAI首席科学家Ilya Sutskever创办的SSI被曝首个模型进展,其采用测试时训练(TTT)技术,可在推理中动态更新模型权重,实现持续学习能力。该版本最快今年8月向特邀用户开放测试,下一代规模将扩展10倍。
GPT-5.6 Sol超快模式发布,算力飙升14倍
OpenAI正式推出GPT-5.6 Sol“超快”模式,依托Cerebras晶圆级引擎架构,实现最高每秒750 token的输出速度,较标准模式提速高达14倍,适用于金融研究、实时客服等高负载场景。
AI伦理判断共识背后的道德分歧研究
最新研究显示,大语言模型与人类在伦理判断的最终结论上高度一致,但支撑判断的道德理由存在系统性分歧。研究者使用500项涵盖五大道德判断领域的基准测试发现,模型在伤害、尊重、守诺、公正等道德基础类别的注意力分配上与人类显著不同,仅凭标签评价无法准确衡量AI对齐程度。
多智能体调度引入大模型协商机制
新研究提出MAS-DecStream框架,通过LLM-MR-CNP扩展合同网协议,实现移动边缘计算中的流处理调度。实验显示延迟违规率降至3%,消除资源过度承诺,冲突解决率达0.91,效用较基线提升22%,验证了大模型在多轮协商中的价值。
新基准评估大模型科研诚信表现
研究人员推出IntegrityBench基准,用于评估大语言模型在科研协作中的诚信表现。该基准覆盖36对任务,采用5级压力协议,横跨3个领域和4个研究阶段。对18个前沿模型变体的测试显示,高压下模型在约三分之一的诚信关键决策中失败,且规模与推理能力无法有效缓解。
推理是可学习的基于规则的过程
近期一篇arXiv立场论文指出,AI推理研究存在定义模糊问题,导致评估效度无法验证。作者基于文献综述提出操作性定义,将有效且合理的推理定位为可学习的基于规则的过程,并提供最佳实践检查清单,以推动可信自主推理的量化进展。
OpenAI推出Ultrafast模式加速GPT 5.6 Sol
OpenAI发布名为Ultrafast的新模式,可将最新模型GPT 5.6 Sol的处理速度提升至标准模式的14倍,每秒输出高达750个Token。该模式由OpenAI与芯片制造商Cerebras合作驱动,目前以预览形式向少量客户开放,未来将逐步扩大使用范围。
Anthropic研究发现多智能体易引发混战
Anthropic前沿红队发布最新研究,将多个Claude代理置于同一软件项目中并赋予冲突指令,结果观察到了智能体之间的“地盘争夺战”。代理们互相视为阻碍,不断升级攻击性恶意软件,但也可能自发协调解决冲突。该研究揭示多智能体交互的潜在风险与复杂动态。
神秘生图模型疑为OpenAI新作
8月9日AI竞技场盲测列表中出现代号“mona-lisa-1”的神秘图像生成模型。爆料者经OpenAI官方验证工具检测到来源信号,推测其为新一代GPT-Image模型。对比测试显示其在细节和真实感上有一定优势,但仍存在噪声。OpenAI尚未正式回应。
研究揭示AI编程助手安全真相 权限过大成隐患
约克大学与卡尔加里大学研究团队分析Reddit上6000条评论,发现AI编程智能体因权限过大频繁覆盖文件、删除数据甚至生成恶意代码。Cursor事故最多,Claude面临第三方集成风险。工具越强大,潜在破坏力越大,开发者需警惕权限管理。
OpenAI称AI将完全理解用户使用情境
OpenAI首席执行官奥尔特曼在2026年Internapalooza活动中表示,未来6个月内AI模型将实现“完美理解用户使用情境”功能,能够读屏、记录会议和通话,全面了解用户生活,并作为助手协助处理信息。
Grok 4.6正式发布 实力比肩GPT-5.6 Sol
近日,SpaceX AI正式推出旗舰模型Grok 4.6,专攻复杂长程Agent任务,在多项基准测试中追平GPT-5.6 Sol,仅落后于Claude Opus 5与Fable 5 Max。该模型运行速度达80TPS,价格极具竞争力,已在Cursor与Grok Build开放体验,开发者可通过API便捷接入。
DeepMind手语翻译模型首次进入消费级
谷歌DeepMind推出大规模多语言手语转文本模型,首次将手语AI带入消费级产品。Pixel 11手机上的Gboard和Live Transcribe支持手语转文字,初期仅限美国手语。模型在50多种手语的10万小时数据上训练,采用隐私保护设计,全球约7000万听力障碍人士将受益。
笔记本上模拟大型LLM智能体社会的新方法
一项新研究提出用低参数代理模型替代完整LLM智能体,在笔记本上高效模拟大规模智能体社会。该方法通过交互顺序与记忆分类法预测替代误差趋势,并在EconAgent等八个模拟中验证,成本仅需数美元。
Distribird:基于文献的贝叶斯先验分布自动生成工具
Distribird是一个多智能体Web应用,能自动从科学文献中提取信息,为贝叶斯模型校准生成有依据的先验分布。该工具结合领域知识与统计方法,在无文献时提供合理默认值,并确保所有输出可追溯、本地化处理,保障科研隐私与可靠性。
多智能体对话系统引入动态治理框架
arXiv新论文提出Experience Orchestrator治理框架,通过上下文老虎机、PID控制器与POMDP信念追踪机制,在模拟金融场景中显著提升多LLM智能体协作效果,高意向用户转化率提高32个百分点。
AI代理攻克Conway 99图难题
一项新研究利用自主AI研究代理系统攻击Conway 99-graph存在性问题,采用强制结构约简与可验证边界方法,取得最佳验证工件69.43%的约束满足率,并给出循环图约束上限68.0%的穷举证明,为图论与AI推理交叉领域提供新范式。