OpenStarry Blog

标签:行业分析

「行业分析」分类下共 29 篇文章。

全部行业分析AI 前沿API工程 实践服务升级AI行业观察行业观察成本与计费Coding PlanIDE 配置工具对比平台接入选型指南 + 效率实战对比评测场景对比 · 客观评测技术解读🔧 技术教程工程落地指南选型指南AI Agenttoken计费LLM 评估实践教程效率实战个人AI行业观察前沿趋势技术教程# 大模型订阅套餐工具教程套餐指南接入教程答疑AI Agent 平台CodexGLM-5.2, API, 错误码, 开发者, 教大模型 开发工具生成模型AI 基础RLHF/对齐RAG/检索训练优化IDE 接入教程ChatGPT 国内接入Claude 国内接入技术深度成本优化
📌 行业分析

Amazon SageMaker 上线前缀感知路由:长上下文 LLM 推理的延迟优化路径

Amazon SageMaker Inference 推出前缀感知路由策略,根据请求前缀将相同开头的请求路由到同一实例,使 KV 缓存保持温热。在 Llama 3.1 70B 的测试中,P50 首 token 时间最多降低 77%,KV 缓存命中率从约 25% 提升到 80% 以上。本文梳理其适用场景、选型标准、配置方法与落地注意事项。

📅 2026-09-11
📌 行业分析

2B参数跑出通用Agent雏形:端侧模型MiniCPM5-2B开源

面壁智能与OpenBMB开源的MiniCPM5-2B以2B参数规模,在AA榜单4B以下模型中登顶,并在Agent能力指标上展现明显领先,同时具备低token消耗的推理效率。本文从用户价值、适用场景、选择标准与落地路径四个角度,拆解这款端侧模型的实用意义。

📅 2026-09-10
📌 行业分析

当AI攻破黎曼猜想67%:数学研究新范式与工具选择指南

AI辅助数学研究取得重大进展——将黎曼zeta函数非平凡零点位于临界线的下界提升至67.25%,相比此前41.6%的纪录一举提高25.6个百分点。本文解析这一突破对数学研究者、学生及工具使用者的实际价值、适用场景、评估标准与上手路径。

📅 2026-09-09
📌 行业分析

GPT-6将孪生素数间距上界推进至186

GPT-6在解析数论中把孪生素数间距的上界从246压缩到186,并配套开源了Lean 4形式化验证代码与完整推理文档。本文从用户视角拆解这一突破的方法、边界、可验证性与上手路径。

📅 2026-09-07
📌 行业分析

AI创作门槛下移:一个人也能做出产品的时代来了

B站首届AI创造公开赛落幕,超3万份投稿、1.34万名创作者参与,其中超八成是一人团队、超六成是非专业开发者。本文从参赛者画像、获奖作品特点、平台与产业支持等维度,拆解AI创作对普通人的价值、适用场景与落地路径。

📅 2026-09-06
📌 行业分析

Grok Bot 重新定义 AI Agent:用户价值、适用场景与落地指南

Grok Bot 以零配置、云端电脑和持久化多智能体协作为核心特征,将 AI 从辅助工具推向主动执行者。本文从用户价值、典型场景、搭建步骤、成本与选型、落地注意事项五个维度,帮助读者判断它是否值得尝试。

📅 2026-09-04
📌 行业分析

读懂 AI 工程新名词:循环、套件、团队与爬坡

围绕 AI 工具链中常见的循环工程、Ralph 循环、多智能体团队、套件工程、爬坡改进、模型开放度等术语,本文梳理它们对开发者的实际价值、典型适用场景、判断标准以及落地成本,帮助团队在选型与搭建时少走弯路。

📅 2026-09-03
📌 行业分析

BenchMIRT:用项目反应理论拆解大模型评测基准的真实信号

BenchMIRT 是一种基于多维项目反应理论的大模型评测基准审计方法,可以在题目级别识别一个基准分数背后混合了哪些能力信号。研究者在 100 个大模型与 16 个基准、超过 3.4 万道题目的数据上验证了其有效性,并发现部分被归类为"安全"的基准实际上与"通用推理"能力相关性更强。本文面向使用与设计评测的人,介绍它的适用场景、选择标准与落地方式。

📅 2026-09-02
📌 行业分析

中文推理训练:与英文推理的性能差距已收窄到约1个百分点

一项覆盖9个基座模型、11种语言、超过200组对照实验的研究显示,用中文做GRPO强化学习推理训练,与用英文推理相比的性能差距约为1.1个百分点,远低于此前多项研究报告中超过10个百分点的水平。这一结果为中文推理模型从训练源头走独立路线提供了数据支撑,同时研究也揭示了跨语言迁移的收益边界和特定组合下的性能回退风险。

📅 2026-09-01
📌 行业分析

滴滴自动驾驶新一代车型R2开启载客测试:用户价值与上手指南

滴滴自动驾驶与广汽埃安联合打造的Robotaxi R2在北京、广州部分示范区域开启无人载客测试服务。文章从用户视角出发,分析新车在乘坐体验、安全冗余和智能交互上的升级,并给出适用人群、选择标准与上手步骤,帮助读者判断这一新形态出行服务的实际价值。

📅 2026-08-31
📌 行业分析

Scientific Agent Skills:让 AI Agent 成为科研助手的技能合集

围绕 Scientific Agent Skills 技能库,介绍其从 Claude 专属走向开放标准的变化、覆盖的科研领域、适用人群、选择评估维度与上手落地建议,帮助科研用户判断是否引入。

📅 2026-08-30
📌 行业分析

Anthropic两款新模型浮出水面:旗舰遇冷背后的选型逻辑

面对旗舰Fable 5市场份额不及预期、Opus 5迅速反超的局面,Anthropic即将推出Marshmallow与Melon两款新模型。本文从用户价值、适用场景、选型标准与落地建议四个角度,分析企业如何在大模型预算分配中做出更理性的取舍。

📅 2026-08-27