研究团队表示,三款模型基于相同的基础训练数据集,高一致率的结果符合预期。真正具备研究价值的是模型间25%的分歧部分,这种差异大概率并非源于模型对工具质量的独立判断,而是由基于人类反馈的强化学习(RLHF)调优策略不同,以及生成环节的专属微调差异导致。
还在纠结 Claude Code 的各种“黑魔法”怎么玩?Command、Subagent、Skills 到底有什么区别,各自适合什么场景?新出来的 Programmatic Tool Calling 又是啥,真的能提升「代码质量 + 开发效率」吗?因为一个工具不得不搭梯子,有没有体验接近、甚至更灵活的「平替」方案?本次分享将带你彻底搞懂~Claude Code ...
这个功能本来是为了支持热切换和故障转移,因为 Claude Code 在 2.49 版本之前没有热切换,改了供应商必须重启终端才能生效。 比如 Plan 或者执行就用 Opus 4.6(现在是 4.5),如果是 debug 或者 read 代码就用 ...
在2026年,阿里云百炼平台正式推出了一项颠覆性的新服务——Coding Plan。这项创新服务为用户提供了更灵活且强大的AI模型使用体验,标志着阿里云在多模型服务领域迈出了重要一步。 Coding Plan:打破单一模型的束缚 Coding Plan的推出整合了四大开源模型的API接口 ...
什么值得买社区频道 on MSN

讯飞星辰 MAAS 白嫖 GLM5 踩坑记录

最近发现讯飞星辰 MaaS 平台有免费的 GLM-5 大模型,尝试接入了自己的 NEW-api 分发平台踩了几个文档里不会告诉你的坑。本文记录完整的 ...
在当下“AI助手”加速融入我们日常生产和创作的时代,如何让这些对话式AI的工具更生动、更具交互性,成为开发者思考的重点。今天要介绍的开源项目——MCP Apps Extension(@modelcontextprotocol/ext-apps),正是为了解决“AI聊天中如何嵌入可交互界面”这一痛点而诞生的。 一、MCP Apps 是什么? MCP Apps 是 Model Context Prot ...
芒果测试平台是一款集UI、API和Pytest于一体的低代码测试平台。通过简单的配置即可完成UI和API自动化测试,无需编写代码,简单易用!
Anthropic正在加速补齐其在 AI 智能体(Agent)领域的最后一块短板。2026年2月26日,据报道,Anthropic已正式完成对西雅图 AI 初创公司 Vercept 的收购。 这次收购的核心目标非常明确:通过 Vercept 顶级的视觉理解技术,让Claude能够像人类一样,真正“看懂”屏幕并精准操控各类软件。
去年的SIGGRAPH,英伟达推出GH200、L40S显卡、ChatUSD轮番登场。而今年的主角,是英伟达在生成式AI时代的新王牌—— “Nvidia NIM”全新升级 ,并且通过NIM 将生成式 AI 应用于 USD(通用场景描述),拓宽AI在3D世界的可能性。
今年春节档的票房统治者莫过于《飞驰人生3》。大年初一以4亿票房强势登顶,贡献档期超30%份额;次日更是逆势增长破10亿,较第二名《惊蛰无声》拉开近4倍差距。来到2月21日,票房已破20亿元(含预售)。 延续前作热血赛车与幽默风格,电影讲述了主人公张驰(沈腾饰)在赢得巴音布鲁克拉力赛冠军后,面临团队解散,赞助撤离和AI新能源赛车冲击的困境。一次意外邀约,张弛的赛车梦再次被点燃。
知名 AI 编程软件 Windsurf在发布 4个月内用户数破百万、年度经常性收入 (ARR) 超过1亿美元、企业客户数量超过1000家。Windsurf的团队仅有不到160人,最终以30亿美元的估值卖身OpenAI,这也成为OpenAI史上规模最大的收购 [1] 。
M2.5模型实现性能与成本的双重突破。价格仅为GPT-5等主流模型的1/10至1/20。性能比肩Claude Opus,在多语言编程测试Multi-SWE-Bench夺冠,任务完成速度较上代提升37%。采用原生Agent强化学习框架,内部已有30%任务由AI自主完成,编程场景代码生成占比达80%。