「行业分析」分类下共 29 篇文章。
Amazon SageMaker Inference 推出前缀感知路由策略,根据请求前缀将相同开头的请求路由到同一实例,使 KV 缓存保持温热。在 Llama 3.1 70B 的测试中,P50 首 token 时间最多降低 77%,KV 缓存命中率从约 25% 提升到 80% 以上。本文梳理其适用场景、选型标准、配置方法与落地注意事项。
面壁智能与OpenBMB开源的MiniCPM5-2B以2B参数规模,在AA榜单4B以下模型中登顶,并在Agent能力指标上展现明显领先,同时具备低token消耗的推理效率。本文从用户价值、适用场景、选择标准与落地路径四个角度,拆解这款端侧模型的实用意义。
AI辅助数学研究取得重大进展——将黎曼zeta函数非平凡零点位于临界线的下界提升至67.25%,相比此前41.6%的纪录一举提高25.6个百分点。本文解析这一突破对数学研究者、学生及工具使用者的实际价值、适用场景、评估标准与上手路径。
GPT-6在解析数论中把孪生素数间距的上界从246压缩到186,并配套开源了Lean 4形式化验证代码与完整推理文档。本文从用户视角拆解这一突破的方法、边界、可验证性与上手路径。
B站首届AI创造公开赛落幕,超3万份投稿、1.34万名创作者参与,其中超八成是一人团队、超六成是非专业开发者。本文从参赛者画像、获奖作品特点、平台与产业支持等维度,拆解AI创作对普通人的价值、适用场景与落地路径。
Grok Bot 以零配置、云端电脑和持久化多智能体协作为核心特征,将 AI 从辅助工具推向主动执行者。本文从用户价值、典型场景、搭建步骤、成本与选型、落地注意事项五个维度,帮助读者判断它是否值得尝试。
围绕 AI 工具链中常见的循环工程、Ralph 循环、多智能体团队、套件工程、爬坡改进、模型开放度等术语,本文梳理它们对开发者的实际价值、典型适用场景、判断标准以及落地成本,帮助团队在选型与搭建时少走弯路。
BenchMIRT 是一种基于多维项目反应理论的大模型评测基准审计方法,可以在题目级别识别一个基准分数背后混合了哪些能力信号。研究者在 100 个大模型与 16 个基准、超过 3.4 万道题目的数据上验证了其有效性,并发现部分被归类为"安全"的基准实际上与"通用推理"能力相关性更强。本文面向使用与设计评测的人,介绍它的适用场景、选择标准与落地方式。
一项覆盖9个基座模型、11种语言、超过200组对照实验的研究显示,用中文做GRPO强化学习推理训练,与用英文推理相比的性能差距约为1.1个百分点,远低于此前多项研究报告中超过10个百分点的水平。这一结果为中文推理模型从训练源头走独立路线提供了数据支撑,同时研究也揭示了跨语言迁移的收益边界和特定组合下的性能回退风险。
滴滴自动驾驶与广汽埃安联合打造的Robotaxi R2在北京、广州部分示范区域开启无人载客测试服务。文章从用户视角出发,分析新车在乘坐体验、安全冗余和智能交互上的升级,并给出适用人群、选择标准与上手步骤,帮助读者判断这一新形态出行服务的实际价值。
围绕 Scientific Agent Skills 技能库,介绍其从 Claude 专属走向开放标准的变化、覆盖的科研领域、适用人群、选择评估维度与上手落地建议,帮助科研用户判断是否引入。
面对旗舰Fable 5市场份额不及预期、Opus 5迅速反超的局面,Anthropic即将推出Marshmallow与Melon两款新模型。本文从用户价值、适用场景、选型标准与落地建议四个角度,分析企业如何在大模型预算分配中做出更理性的取舍。