1模型发布/更新
Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。
2产品发布/更新
GLM-5.3 API即日上线,擅长复杂编码、防御性网络安全与长程任务,在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低。API定价与GLM-5.2持平,模型权重将于下周五开源。
一段 5 秒 480P 视频,完全在 Mac 上生成,耗时 30 秒。无需 CUDA,无需云端,仅占用 3.9 GiB 内存。 FastMetal 将 FastWan-QAD 系列带到 Apple Silicon。DiT、DMD 采样器和解码器均通过 MLX 在 Metal 上运行,默认 INT8。 三个模型:1.3B 支持 480P,5B 支持 720P,14B 追求画质。 📷 博客:http://haoailab.com/blogs/fastmetal 📷 代码:http://github.com/hao-ai-lab/FastVideo 📷 模型:http://huggingface.co/collections/Fas…
Google 在搜索中推出 5 项 AI 学习工具。AI Mode 的生成式 UI 已全球上线英文版,支持交互式可视化与自定义模拟;练习测验现已在 AI Overviews 和 AI Mode 中免费提供英文版,覆盖 ACT、SAT 等标准化考试。
Replit 推出由 GPT-5.6 Luna 驱动的 Free Mode,让用户无需担心 token 成本即可将想法转化为可运行的软件。该模式借助 GPT-5.6 系列的价格性能优势及 OpenAI 近期降价,向数百万用户开放,提供快速解答、建议与项目分析,并可在需要更高级推理时切换至 GPT-5.6 Sol,同时保留项目上下文。
Claude Code v2.1.236 新增 ANTHROPIC_DEFAULT_MODEL 环境变量,可设置新会话默认模型,且 /model 选择仍可覆盖并跨重启保留。
3行业动态
Anthropic 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到“关键网络安全能力阈值”,暂时放缓模型扩展速度,包括暂停最新模型两周的强化学习(RL)训练。公司已加强研究环境安全要求,包括工作负载隔离、网络隔离和持续安全测试,并扩大思维链监控范围。涉及 Astra 或网络模型的工作负载需满足最严格安全标准,部分训练和评估工作仍处于暂停状态。
OpenRouter 宣布与 Stripe 合并,以加速推动全球经济增长。OpenRouter 目前每日处理来自 400 多个 AI 模型的 10+ 万亿 token,服务超 1000 万开发者与公司,自成立以来推理量每年至少增长 10 倍。合并后 OpenRouter 将继续以原名、原使命独立运营,产品与路线图不变,路由决策仍以用户利益为先,交易预计在未来数周内完成。
4论文研究
LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上通过场景化服务配置逼近 B300 性能。单节点 H20-141GB 参考实现达 271 output tokens/s,与 B300 的 383.7 tokens/s 性能差距缩小至 1.42×。
苹果机器学习研究团队对 LLM 的类人行为(如表达想法与情绪、与用户建立关系、拒绝请求并保持边界)进行了多维度分析,涵盖其普遍性、潜在影响与可控性。研究采用 LLM-as-a-judge 与人工评估相结合的方法,样本规模超过 21,000 条数据,旨在为研究者与实践者提供关于何时及何种类型类人行为的决策依据。
现代 AI 智能体依赖搜索基础设施执行神经符号推理,常编译为深层嵌套的非单调布尔查询。标准倒排索引查询评估策略面临严重理论限制:有状态迭代器模型(Document-at-a-Time)受 NC^1 公式评估结构约束,展开重汇聚逻辑时最坏情况查询复杂度呈 O(2^|Q|) 指数级爆炸。
5技巧与观点
GitHub Copilot app 的 My work 面板将拉取请求和问题集中在一处管理,内置 All、Active、Review requests、Done 四个默认视图,并支持创建自定义视图与过滤器。用户可从问题或拉取请求直接启动新的智能体会话,也可批量选择多个条目创建会话,还能在列表视图和表格视图间切换,并调整仓库范围或新建问题。
Slack 首席产品官 Jaime DeLanghe 分享了将对话转化为机构知识、构建人机智能体团队的最佳实践。她主张默认使用公开频道,让智能体从可见对话中学习,并建议将会议、邮件、日历等上下文连接起来以减少重复劳动。在 Slack 中由 Claude 驱动的智能体负责起草、总结、监控等生产工作,人类负责审查、决策与交接,形成循环协作。
Databricks 发布指南,探讨如何从单一提示词设计高效的 Genie Agents。文章指出,通用智能体在处理收入等查询时,往往只会抓取第一个相关数据表,而 Genie Agents 通过更精准的提示词设计,能更准确地定位和回答用户问题。该指南旨在帮助开发者优化智能体行为,提升查询结果的准确性和相关性。