Real-SWE:用企业私有代码库出题,最强模型也只做对 38.8%
【摘要】 第一,Specific Labs 于 2026 年 9 月发布 Real-SWE,所有任务来自真实企业授权的私有生产代码库,模型没见过、也背不到答案,直接针对 SWE-bench 类公开榜的数据泄露问题。 第二,首榜测了 10 个任务、8 种”模型 + 原生 harness”组合、共 ...
深度测评、技术分享、AI 工具解读,帮你做出更好的选择。
【摘要】 第一,Specific Labs 于 2026 年 9 月发布 Real-SWE,所有任务来自真实企业授权的私有生产代码库,模型没见过、也背不到答案,直接针对 SWE-bench 类公开榜的数据泄露问题。 第二,首榜测了 10 个任务、8 种”模型 + 原生 harness”组合、共 ...
【摘要】 第一,6TB中转调用日志若披露属实,真正危险不是“又一批数据泄露”,而是大模型中转层已经变成企业高权限凭证集中池:SSH私钥、VPN配置、阿里云密钥、GitLab令牌、Agent工具返回、代码与运维日志全在同一链路,单点被买走即可横向进入19家企业与7家政科机构内部系统。第二,428个...
摘要第一,DarioAmodei于2026年9月12日发布《WeMustPace theFrontier》,核心不是停训,而是把前沿模型能力增速主动降一档,让安全评估、对齐、可解释性追上智能体失控风险。第二,可落地动作只有第一步:Anthropic向METR等第三方评估员开放员工级永久访问,配工位、门禁、公司笔记本,评...
【摘要】 第一,Google 自 2026 年 6 月起灰度、8 月 26 日确认全面 rollout:自然搜索结果的链接从直接指向目标页,改写为 google.com/goto?url=[不透明 token],真实 URL 只在请求 /goto 后的 Location 响应头里出现。 第二,这不是排名算法更新,而是数...
【摘要】 第一,熵旋芯智CEO雷坤在2026算力中国科创路演上的核心主张——“MRAM存算一体能耗比SRAM低近10倍、Token成本降约10倍”——不是营销口号,而是有学术根基的工程推演,但”10倍”是特定条件下的上限值,...
【摘要】第一,MiniMax Music 3的定位不是“再做一个写歌玩具”,而是把歌词、结构标签、音乐描述、长程编曲和人声合成压缩到一次生成,最长5分钟、32kHz/16bit立体声WAV,开放权重可本地跑。第二,真正有用的是生产链而不是单首demo:提示词写结构、模型出编曲与人声、工具链做混音...
【摘要】第一,Fugu Max不是新底座,而是把开放权重与专用模型组成可调度池,按任务复杂度选最便宜可完成模型,官方口径为同类价格区间下以2到6倍更低成本接近精英模型质量。第二,Fugu Ultra v2走另一头,面向多步推理、自主研究、全栈代码与图表理解,用更深编排换峰值能力,不在所有任务上都省成本。第三,真正变化在...
一、综合画质/艺术感:MJ、GPT Image、Gemini Midjourney:V8.1标准图约4秒出2×2网格、HD约12秒;按Fast GPU时长卖不按张卖,Basic 10美元/月3.3快GPU小时、Standard 30美元/15小时、Pro 60美元/30小时、Mega 120美元/60小时,...
【摘要】第一,TraeWork走“Work+Code+Design三模式、网页桌面移动三端、云端任务为主”的路线,强在开发到办公接力、跨设备派活、积分制按模型和任务消耗;技术团队、飞书/GitHub场景、经常手机下发电脑验收的人最合适。第二,WorkBuddy走“本地桌面执行+腾讯生...