08:08·meng shao
Datawhale与RadixArk(SGLang)联合发起开源课程,引导学习者从零构建mini-sglang并吃透SGLang源码。课程分四部分:Part 0建立伦理规范与部署服务;Part I通过五章概念课建立LLM推理认知底座,涵盖Prefill/Decode、Roofline模型等;Part II十章手搓引擎核心,按正确性到扩展递进实现KV Cache、Continuous Batching等;Part III由SGLang官方成员编写,深入Attention后端、量化、PD分离等前沿优化;Part IV教授Profiling、Trace及PR工作流,旨在培养贡献者。
#SGLang#教程#LLM推理
02:26·r/LocalLLaMA(Reddit)
Reddit用户skeole分享了一项为期约21天的本地Agent实验,使用量化版Qwen3.8-27B模型在单张RTX 3090显卡上自主构建针对该GPU架构优化的CUDA推理引擎。实验通过编写详细规则书(包括角色定义、交接协议及禁止事项)引导模型进行无监督开发,期间经历多次上下文压缩与协议级错误修复。最终模型生成了可工作的内核代码与基准测试数据,预填充速度达到llama.cpp的一半水平。该实践展示了消费级硬件支撑长周期复杂工程任务的可行性,并开源了包含15GB数据的协议记录与相关后端工具。
#Qwen#LocalLLM#Agent
01:06·r/LocalLLaMA(Reddit)
Reddit用户Nandakishor_ml开源了决策模型Laya,另一位开发者在此基础上构建了C++推理引擎laya.cpp。该实现基于ggml框架并包含自定义CUDA内核,支持英语、多语言及类型化决策三种检查点,提供原生分词、模型执行与输出格式化,无需Python或PyTorch即可运行,并附带兼容JEV协议的HTTP服务接口。在RTX PRO 6000 Blackwell显卡(功耗限制450W)上的测试显示,C++ BF16版本在批量为1至8时,每秒处理问题数显著高于Python BF16版本,例如批量为2时,C++达到586 QPS,而Python仅为268 QPS。
#Laya#laya.cpp#推理优化
18:00·WquGuru
作者利用 OpenRouter 上的 Jev 1.13 模型,结合 NewsHub 三个月的投资日报与持仓数据,自动输出标的买卖决策及置信度,并通过程序对接 Binance K 线进行模拟交易。在 77 天、5 个标的的测试中,Jev 共生成 1155 次决策,全程耗时仅 87 秒,API 成本 $0.09。其中动量策略收益 +6.71%,但未跑赢基准。随后,作者将原始 JSON 数据输入蚂蚁百灵开源的 Ling-3.0-flash-VL 多模态模型,该模型无需标注直接根据设计稿构建动态仪表盘前端,并利用 Playwright 逐帧截图合成 13 秒视频,直观展示净值曲线与决策流。
#Jev#Ling-3.0-flash-VL#AI Agent
13:49·Hacker News Best(web_list)
Dan Luu指出,随着LLM能力提升,越来越多开发者尝试“关闭大脑”让AI自主生成代码并假设其有效。尽管这种“肉代理”模式在2025年初效果不佳,但如今已能产出勉强可用的软件。然而,作者强调该方法对员工毫无价值,因为公司最终只需运行LLM循环即可裁掉人类。文中引用Luke Burton的观点,指出在高价值任务中,人类仍需扮演QA、架构师角色,且面对分布外(out-of-distribution)问题时,AI表现远逊于人类。即使AI进步,完全无人工干预的开发模式仍面临巨大挑战,人类必须持续介入以处理复杂决策与未知问题。
#Dan Luu#AI编程#工程实践
11:44·r/LocalLLaMA(Reddit)
Reddit用户分享在6张V100显卡上运行Qwen3.8-Next的完整经验。针对多卡发热问题,作者进行了严格的温度测试,20分钟压力测试后温度稳定在64°C左右,风扇转速约76%。调试过程中,sglang-v100和pxa引擎均出现OOM或报错,最终通过调整1cat-vllm配置实现稳定运行,采用TP2 PP3并行策略。性能方面,长上下文处理速度随长度增加先升后降;启用MTP(多令牌预测)后,文本生成吞吐量从平均22.59 tok/s提升至42.70 tok/s,几乎翻倍。该帖提供了具体的硬件环境、引擎排查路径及量化数据,对本地大模型部署者具有参考意义。
#Qwen#V100#部署技巧
10:09·meng shao
Databricks CEO Ali Ghodsi与a16z合伙人对谈,认为AI生存风险接近零,批评“控速”公关策略。他指出递归自我改进的四项条件均未满足,当前RSI实为自催化效应,并透露公司90%代码由AI编写。真正的近期威胁是AI驱动的网络攻击,漏洞武器化已缩至小时级。企业落地瓶颈在于缺乏“组织本体”,需构建知识图谱以赋予Agent上下文。此外,通过Unity Gateway实现智能路由与多模型分层,成功弯折成本曲线;收购的Neon数据库因适配Agent特性成为首选。
#Databricks#Ali Ghodsi#Agent
09:01·meng shao
Thorsten Ball 指出,随着模型产出代码质量超越人工审查能力,传统软件工程工艺与流程正面临解体。Code review 因无法逐行排查而失效,单测在模型零错误输出前失去意义,以“人读改”为基准的“好代码”标准对 Agent 不再适用。人的价值从编码工匠转向架构者,核心在于理解业务与把握反馈循环,Bug 将主要源于需求偏差而非实现错误。现有协作范式如敏捷、Scrum 及 PM/设计/工程三权分立不再合理,终端与 UI 将被即时生成的 Token 交互取代。Token 成为新生产资料,智能模型通过减少轮次降低错误率,这一范式转变需一代人时间完成。
#Thorsten Ball#软件工程#AI范式