今日,海外权威 AI 模型评测平台 LLM Stats 更新榜单,云知声 U2 登上两项关键评测:在 LLM Stats Score 综合能力榜单中进入模型总榜前 30,按厂商最佳模型成绩位列全球模型厂商第九;同时,在平台收录的独立长上下文评测基准 LongBench-V2 中,U2 以 54.4% 的Accuracy 超越 Claude Opus 4.7。

LLM Stats Score 不是为了刷榜而设计的单一测试集排名,而是面向真实工作负载构建的综合能力评分体系。其综合分数来自公开来源、独立采样测量与经验证的 benchmark 结果。在此基础上,LLM Stats Score 覆盖推理、代码、知识、工具与智能体、长上下文等多个维度,更接近对模型综合战斗力的横向检验。
LongBench-V2 则是当前长上下文推理领域的高难度评测基准之一。该测试集包含 503 道多选题,上下文长度覆盖 8K 至 2M words,并按 short、medium、long 三个长度区间分别评估模型表现,覆盖单文档问答、多文档问答、长上下文学习、长对话历史理解、代码库理解和长结构化数据理解六大类任务,重点检验模型在不同上下文规模下处理长任务的稳定性。
两项评测成绩,正是 U2 在通用能力与复杂任务处理上持续突破的最好证明。
而支撑这一切的,是 U2 “高智能密度 × 高 Token 价值”的核心技术主张:
作为云知声面向真实任务执行打造的原生智能体大模型,U2一方面通过更高效的模型结构和能力承载方式,在更少激活资源下释放更强推理能力;另一方面通过混合思考机制、长上下文理解和任务链路规划能力,让每一次调用、每一个 Token 都更接近有效交付。
接下来,U2 将持续围绕复杂推理、长文本处理、代码生成与 Agent 任务执行等方向优化,不断提升在真实工作流中的交付能力,做更懂任务执行的大模型。
榜单公示链接:https://llm-stats.com/
欢迎体验 U2:https://maas.unisound.com/models/u2
本平台所发布信息的内容和准确性由提供消息的原单位或组织独立承担完全责任!
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。
责任编辑:kj005
当下细胞营养补充市场快速发展,大众对于日常状态管理、精力维系类营养产品的需求持续攀升不少消费者仅凭网红推荐、流量宣传盲目选购,不仅难以匹配自身日常养护需求,还容...
今日,海外权威 AI 模型评测平台 LLM Stats 更新榜单,云知声 U2 登上两项关键评测:在 LLM Stats Score 综合能力榜单中进入模型总榜...
如果把时间拨回五年前,跨境支付行业最常见的竞争方式其实非常简单谁到账更快,谁手续费更低,谁支持的国家更多,谁就更容易获得用户因此,当时很多平台的宣传重点几乎都围...
作为深耕泰国市场多年、拥有本地直营办公室与专业法律财税团队的出海一站式服务机构,际连集团深知中企赴泰注册公司时,极易在股权、资质、财税、用工等环节触碰合规雷区,...
近日,2026年中国工业硅产业链年会暨工业硅技术研讨会在新疆乌鲁木齐召开行业步入深度调整期在“双碳”战略及能耗双控政策持续推动下,工业硅...
近日,上海美之盈环境科技有限公司(以下简称 “美之盈科技”)宣布完成 1000 万元天使轮融资美之盈科技成立于 2023 年,总部设于上...
国家知识产权局最新信息显示本实用新型提供一种侧面自吸水式冰袋,包括:第一冰袋主体,所述第一冰袋主体的外部两侧均固定安装有第一连接件,且第一连接件的数量为两个,两...