郑南宁院士:三域融合建模前沿方向正在形成
8月8日,《人民日报》5版刊发中国工程院院士郑南宁的署名文章《具身智能,在物理世界中成长》(本报记者采访整理)。文章提出,人工智能的重要发展方向之一,是让机器不仅能处理信息、推演复杂问题,也能在真实多变的环境中灵活完成各类任务。评价具身智能的标准,在于是否能真正解决现实世界中的问题。当前,一个更具前沿性的方向正在形成,即推动“信息—物理—认知”三域融合建模,使智能系统逐步具备更接近人类的整体认知结构。在工业制造领域,智能系统正在从执行工具转向意图驱动系统。具身智能的本质,并不是让机器“像人”,而是让智能真正进入现实世界,在复杂、不确定环境中形成持续学习与适应能力。从数据驱动的大模型,再到面向物理世界的具身智能,人工智能正在经历从符号世界、数据世界到真实世界的连续演化过程。面向未来,具身智能让机器既“懂世界”又“能行动”,将深刻改变生产方式与生活方式,成为推动产业变革和社会发展的重要力量。
阿里巴巴发布基座大模型Qwen3.8-Max
8月3日,阿里巴巴千问Qwen3.8-Max模型上线。据介绍,Qwen 3.8-Max基于Qwen 3.5架构基础构建,参数规模扩展至2.4万亿,激活参数为950亿,支持100万上下文Tokens,在自主编程、专业办公、长程任务、多模态智能体等方面实现能力突破。在自主编程方面,只需输入提示词,Qwen3.8-Max便能创建可运行的自进化智能体框架。该模型能够跨页理解200页的财报,把100小时的长视频组织成可检索、可追溯的Graph记忆。面对长周期任务,Qwen3.8-Max涌现出系统级自主规划与全栈闭环自适应学习能力,并持续重构算法与和策略。有科技媒体称,Qwen3.8-Max的发布,标志着国产通用人工智能大模型朝着高自主性、端到端交付和真实业务场景落地方向发展,并向复杂任务、智能体原生能力演进。
腾讯混元发布语音识别模型HyASR3.0
8月4日,腾讯混元发布语音识别模型Hy ASR 3.0 preview。该模型采用MoE架构与自研语音编码器,基于大语言模型Hy3的语言理解能力,融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、方言覆盖等维度实现提升,从逐字转写演进为理解语境。Hy ASR 3.0 preview重点提升了四类能力,包括通用识别准确度、用户意图理解力、专业场景适配性以及多种声学场景等复杂环境下的稳定性,可应用于智能客服、内容理解、语音搜索等场景。
字节跳动推出音视频全双工大模型SeedRealtime
8月5日,字节跳动发布原生音视频全双工大模型SeedRealtime,并宣布在豆包App全量上线。SeedRealtime采用统一端到端架构,原生融合音频、视频与文本三种模态信号。该模型依赖自动语音识别(ASR)、语音合成(TTS)、视觉模型等多个模块串联,将声音、画面、时序与表达统一到同一个端到端模型中,在连续的多模态信息流上同步完成感知、理解、决策与表达,实现边看、边听、边说的实时交互,在音视频联合理解、主动交互能力、交互节奏流畅度三个方向取得关键突破。
科研智能体OpenAI4S开源
近日,北京大学&元空AI Agent联合实验室正式开源科研智能体OpenAI4S。OpenAI4S采用MIT协议,支持Python/R代码执行,实现数据读取、循环分析、模型调用、可视化和研究报告生成。目前提供30多个内置科研Skills,覆盖蛋白质结构、序列分析和设计,分子对接、单细胞分析等场景,并具备GPU算力接入与版本化产物保存能力。其优势在于能够完整串联从文献检索、数据清洗、算法调用到报告生成的复杂科研流程,避免Agent因步骤断裂导致的返工。
Meta发布编程智能体Muse Code测试版
日前,Meta发布首个AI编程智能体Muse Code测试版。该系统具备在大型代码仓库中自主完成“完整软件工程任务”的能力,涵盖规划修改方案、编写代码、验证结果等环节。Muse Code由Meta超级智能实验室最新推出的基础模型Muse Spark 1.2驱动,采用多智能体协同机制,可自动衍生多个子智能体在隔离环境中并行处理任务。
秩1联想记忆实现无损持续学习
为解决大模型持续学习(Continual Learning)领域绕不开的灾难性遗忘(catastrophic forgetting)问题,澳大利亚新南威尔士大学Artificer AI Lab的研究团队给出一个新答案。研究团队把每一次模型更新拆解为细粒度的rank-1“记忆原子”,让持续学习变成一座参数化记忆库的逐渐式增量生长。该方法为解决干扰(Interference)、冗余(Redundancy)、路由崩溃(Routing Collapse)痛点,带来从“地址式路由”到“内容寻址式检索”的范式转变。该工作已被ICML 2026接收,方法命名为MoRAM(Mixture of Rank-1 Associative Memory)。
附录
人民网、传播内容认知全国重点实验室智能产品
“初芯”智能体平台:集大模型应用、知识管理、智能开发于一体,具有意识形态安全、数据隐私保障、一站式零门槛、赋能深度场景优势,智能体可用于智能传播、智慧舆情、文旅健康、生活服务等各类场景。
主流价值语料库:赋能大模型价值观对齐。优选入库基础语料、问答语料、图文语料等,已在一批主流大模型厂家得到应用验证。
人民智媒大模型:面向党政服务、媒体服务的大模型应用基座。基本解决大模型政治方向、舆论导向、价值取向、事实幻觉等问题,能够协助党政机关、企事业等单位构建各类模型。
“写易”智能创作引擎:面向公务人员、媒体从业者、国企管理者等用户,提供智能写作、智能审校、写作素材知识库调用等服务。
“自在”心理疏导大模型:提供心理疏导、情绪管理、亲子交流和家校共育等服务,已上线国家智慧教育公共服务平台。校园端支持家校心理数据统计与筛查分析。
人民审校和内容风控大脑:提供时政信息表述审校、综合信息审校等内容安全服务,支持文本、图片、音视频等多模态内容审校,可在内容发布前辅助审校,也可在内容发布后开展多平台巡查和风险筛查。
语料社区:致力于打造共创共享的全模态AI语料生态平台,打通语料采集、标注、应用全流程链路,旨在破解高质量中文语料不足和共享难等问题,为人工智能产业发展构建安全、开放的数据基石,促进区域文化数字化建设,助力区域内机构实现语料资源互补互通。
“初见”智能体:汇聚三甲医院专家科普以及国家卫生健康委、体育总局推荐的体重和健身知识,提供健康体重管理建议和多元健身课程,是一款简单实用的健康体重管理助手。
AI经贸文旅智能体:形成平台、数据、算力、算法、模型、智能体“六位一体”创新架构,提供多语种智能翻译服务,实现政策智能查询、智能商贸匹配、智能展销、智能行程规划等应用,满足经贸文旅领域多维度需求。已在广西桂林、宁夏银川落地。
智能硬件“AI之眼”:集成麦克风、摄像头等传感器,面向文博智能导览、户外活动和运动场景,实现多模态交互、智能讲解、导航导览三大核心功能。
人民数据权属审核服务:通过108项确权实质性审查,审核数据来源、权属主体及使用边界,明确数据权属关系。