跳到主内容

日报

LIVE每早八时发报 · 更新于 08:02NewsHub Daily · 中文 AI 资讯精选

新闻枢纽 · 日报

本期 8 事件 · 1 一手信源 · 覆盖 4 家信源
今日头条 · Lead

AI评测先做错误发现,别急着定指标

本组内容的共同主线是:先找对问题,再谈效率与扩展。AI评测的起点不是写指标,而是先用约30分钟的人工抽检完成错误发现;系统之记录只能守成,真正的增长要靠数据层与AI代理策略另建引擎。Step 5与MiMo-V2.6的实测和成本拆解,则为选择模型提供了具体参照。

20:45Lenny's Newsletter(RSS)

AI产品评测:先做错误发现再定指标,避免测错方向

本文指出多数团队在构建AI评测体系时跳过“错误发现”阶段直接写指标,导致测量错误或资源浪费。作者提出错误发现是评测的产品发现环节,需优先执行。核心方法包括:1. 警惕标准漂移(criteria drift):不要仅依赖Agent自动扫描日志,因为Agent难以理解复杂的业务成功定义;2. 人工审查样本以修正标准:通过人工查看具体交互案例(如租赁助手未处理预算异议),明确什么是真正的失败,从而定义正确的评估维度;3. 结合人机优势:利用Agent捕捉明显错误(如工具输出矛盾),同时由人类判断需要业务语境的复杂问题。该流程仅需约30分钟,能识别出被忽视的重大产品缺陷,确保后续建立的指标真正反映产品价值。

#AI评测#错误发现#Lenny's Newsletter

02

产品与增长

Product & Growth5

09:08人人都是产品经理(RSS)

阶跃星辰Step 5 Preview实测:600B参数与极低定价

阶跃星辰发布Step 5 Preview模型,采用MoE架构,总参数600B、激活27B,支持1M上下文与原生视觉理解。API定价极具竞争力(输入7/M token,输出20/M token),仅为Opus 5的1/8。AA智能指数达44分,追平K3,仅次于Qwen3.8-Max和GLM-5.3。实测覆盖五类场景:前端网页开发审美在线;游戏开发可零依赖生成完整塔防游戏并自动优化提示词;视觉任务解析3D模型并生成交互代码;工程任务一次性适配macOS/Linux并修复隐藏Bug;Work场景高效分析数据生成PPT。主要短板为Thinking过程较长导致Coding耗时偏多。该模型将于10月15日开源权重,适合追求低成本与高并发能力的开发者集成至日常工具链。

#AI模型#阶跃星辰#API定价

15:47人人都是产品经理(RSS)

小米MiMo-V2.6开源:大规模RL训练成本与MixRL/MOPD方法拆解

小米发布并开源MiMo-V2.6系列,定位RSI路线。核心做法是区分任务类型进行强化学习(RL):代码等稳定验证任务用MixRL混合训练以获泛化;游戏、3D等高难或主观任务拆分训练防效率下降,再用MOPD合并能力。训练全程公开数据:两轮RL耗资约347万美元,处理1564亿Token,Flash版85万,Pro版262万。API定价延续V2.5,Flash输入0.14美元/百万Token,Pro输入0.435美元。同时开放模型权重、技术报告、7000+ RL环境及完整RL框架,供研究者复现。

#强化学习#开源模型#训练成本

15:45人人都是产品经理(RSS)

Jev模型在Drape、Polar等产品的应用控制与成本收益分析

TypeSafe公开的Jev模型不生成文本,仅接收状态信息和一组问题,返回选择结果、分数或概率。本文通过多个案例解析其落地逻辑:1. Drape虚拟试衣:Jev读取用户语音转文字及衣橱信息,620毫秒内选出最佳搭配,单次成本约0.0011美元;2. Polar Browser招聘筛选:基于候选人资料进行受约束判断,无需重写产品流程;3. Keep.md优先收件箱:对数百条收藏内容持续评估阅读优先级,解决累积成本与延迟问题;4. StealAds广告分析:逐条判断广告属性,724条广告8724次判断耗时40秒,成本9美分。核心结论是Jev适合答案有固定选项、程序需反复跑大量判断的场景(如路由、筛选、检查),而非需要现场生成代码或文本的任务。

#Jev#应用控制#成本优化

15:39人人都是产品经理(RSS)

9月增值税新规:套餐、赠品与折扣的税务合规实操指南

针对9月1日起实施的增值税新规,文章提供了一套从业务判断到系统落地的完整合规流程。核心在于先判定交易性质:若设备、安装、维护可独立销售且无主附关系,按多项交易分别计税;若存在明确的主业与补充关系(如卖设备带安装),则按主业税率统一计税。对于整体折扣,必须按比例分摊至各明细行,严禁仅在发票备注栏注明或随意归集到低税率项目,否则无法享受折后计税。赠品需区分是包含在总价中还是独立无偿转让,并保留关联证据。执行层面要求财务、销售、法务与IT协同,梳理现有场景并制定规则,重点检查订单能否记录套餐结构、计价系统能否分摊混合税率折扣、开票系统能否生成明细折扣行。建议通过典型业务全流程跑通合同、订单、发票与入账数据的一致性,确保税务判断结果在各系统中贯通,避免临时改票与调账风险。

#税务合规#定价策略#SaaS

01:17The Pragmatic Engineer(RSS)

Windows AI Agent原生支持:身份隔离与本地模型运行机制

本文基于微软 Windows 团队访谈,详解 AI 时代操作系统层面的开发者工具变革。核心做法包括:1. Agent 身份与发现:通过 Entra ID 为 AI Agent 分配本地唯一身份(如 Task Manager 中显示独立用户),实现与人类用户的区分及统一的可观测性;2. 安全隔离:Defender 杀毒软件升级为“Agent Aware”,扫描并识别本地 Agent 活动以防范伪装攻击;3. 本地模型运行:推出 WindowsML 硬件抽象层,支持在 GPU、NPU 和 CPU 上构建和运行本地 AI 模型,未来计划无需 NPU 即可运行小型语言模型(SLMs);4. 开发体验优化:提供集中式 MCP 服务器注册表,简化 Agent 工具调用,并通过 WSL 和 ARM 架构支持吸引开发者回归。

#AI Agent#Windows#本地模型

03

战略与拆解

Strategy & Teardowns1

22:10SaaStr 博客(RSS)

系统之记录仅保留存,增长需靠数据层与AI代理策略

ServiceTitan切断Podium集成却保留客户,证明“系统之记录”(System of Record)是防御性资产而非增长引擎。核心机制在于:高切换成本锁定客户,但无法直接带来新增收入或加速增长。对比显示,Salesforce应用层增速仅7%,而数据层(Data 360)增速达25%;Snowflake产品收入增34%,Databricks超80%。随着AI代理产生海量非结构化数据(如Token、推理日志),传统按存储收费的架构面临失效:SaaS存储成本远高于对象存储,且API调用限制先于存储成本触及瓶颈。结论是,企业需将“记录层”与“数据/代理层”解耦,通过开放平台或专用数据层承接AI工作负载,避免被单一系统的封闭性限制增长潜力。

#系统之记录#SaaS架构#AI代理

05

独立开发与小生意

Solo & Bootstrapped1

18:47人人都是产品经理(RSS)

TradingAgents:用多智能体分工协作实现股票自动研究

TradingAgents 是一个基于 LangGraph 构建的多智能体开源框架,旨在将真实交易机构的研究、讨论与风控流程转化为可协作的大模型工作流。项目通过 GitHub 获得超过 10.8 万 Star,适合用于金融分析研究与量化实验。其核心机制是将股票研究拆解为基本面、技术、新闻与情绪分析师,由多空研究员进行交叉辩论,最后由交易员形成计划并经风控与组合经理审核。这种架构通过分工分析与多空审查,弥补了单次提问缺乏数据验证的缺陷,并支持决策日志与回测功能以辅助复盘。部署方面,项目支持 Windows Subsystem for Linux 加 Docker 环境,仅需克隆仓库、配置环境变量(支持 OpenAI、Google、Anthropic、DeepSeek 等主流服务商)及启动容器即可运行。

#TradingAgents#多智能体#量化投资

往期存档