Meta 现已开源相关代码,让你也能制作搭载其全新 AI 智能体 Muse 的工具。
Meta 推荐的创意包括:把 Muse 放在彩色电子墨水屏上显示提醒;将它装进 HDMI 电视棒,在大屏幕上使用;或把它装到小型触屏设备里,打造一款看起来有点像自制版 Muse Charm 的装置。
Meta 表示:“Muse小工具是你可以自己动手制作的开源设备。你可以为现成的 ESP32 开发板编写程序,也可以用我们的 SDK 配置 Raspberry Pi,再把 Muse 接入显示屏、按钮、传感器、执行器,或工作台上的其他设备。”不过,Meta 也提醒用户:“请自行承担风险!”
Meta 还将免费送出一款自家打造的 Muse Home Link 设备。Meta 表示,借助这款设备,你可以通过社区开发的技能让 AI 助手“开灯、控制电视、把文档发送到打印机”等,具体能做什么取决于你的设备配置。Meta 超级智能实验室的纳特·弗里德曼透露,Meta 共生产了 5,000 台。Muse Home Link 预计将于本月某个时候发货,现在即可登记候补名单。
Safari 27.0 最重要的新功能之一是 Safari MCP 服务器。它允许 AI agents控制浏览器窗口,从而帮助开发者提高工作效率。
要启用 Safari MCP,开发者需要打开“Safari”>“设置”>“开发”,勾选“允许远程自动化和外部代理”。苹果提醒,只有先在“Safari”>“设置”>“高级”中开启“显示网页开发者功能”,“开发”面板才会出现。
Safari 的 MCP 服务器可让你的代理实现以下功能:
• 查看代码在 Safari 中的显示效果
• 验证用户在表单、结账流程、选项等场景中的状态
• 将计算样式和布局与其他浏览器中的显示结果进行对比
• 检查可访问性问题,例如缺少标签、ARIA 属性使用不当以及颜色对比度不足
• 通过导航计时和资源加载耗时来分析性能
除了新增 MCP 支持,Safari 27.0 还修复了近 850 个问题,远超苹果几个月前在 WWDC 上公布的 525 项修复。这些修复涵盖无障碍功能、CSS、编码、字体、表单、MathML、网络和 WebRTC 等众多领域。
Gemini 3.8 Flash 目前采用与 3.7 Flash 相同的首发价格:输入 $0.75/M tokens,输出 $3.75/M tokens。
• Gemini 3.8 Flash:我们迄今最智能的全能型模型。在保持与 3.7 Flash 同等速度和低成本的同时,它全面提升了编码、智能体工作流以及关键多步骤推理能力。
• Gemini 3.8 Flash Cyber:我们迄今能力最强的网络安全模型,在漏洞检测和自动修复方面达到前沿水平。
官方明确该产品属于Exp实验预览版本,不建议直接用于生产环境,正式版上线时间暂未对外公布。
DeepSeek在API平台正式上线实验性质多模态模型DeepSeek-V4-Flash-Vision-Exp,开发者设置model参数为deepseek-v4-flash-vision-Exp即可完成调用。
该版本保留V4-Flash全部文本能力,补齐视觉理解能力,多模态Agent综合表现接近Claude Opus-4.8旗舰水平。
纯文本层面,该模型的推理、知识储备、文本Agent能力与V4-Flash正式版保持对齐,Terminal Bench 2.1、DeepSWE、DSBench-Hard等文本类评测维持原有得分,能够继续胜任代码编写、工具调用、长文档处理等原有业务场景。
在视觉相关Agent基准测试当中,对比原版V4-Flash实现明显跃升,ApexBench、Agents'Last Exam、Chartography等多模态专项评测分数显著提升,可完成截图解析、界面识别、图表读取、图文混合任务,适配GUI智能体、屏幕操作、图文数据分析等开发场景。
计费规则沿用V4-Flash现有定价标准,图片输入会转换为token参与计费,单张图片最高计384 tokens,不会额外收取视觉专项费用,百万token输入缓存未命中1元,输出2元,缓存命中可低至0.02元每百万token,降低多模态Agent开发的调用成本。
模型延续100万token超长上下文窗口,支持思考模式,可设置high、max推理强度,复杂多模态智能体任务推荐开启max档位,适配Harness智能 体框架,支持工具调用、Function Call,能够结合图片理解完成调研、数据提取、自动化任务编排等链路工作。
▎腾讯上线 AI 创意设计平台 Miora:一句话生成图片、视频、UI 与 3D 内容
腾讯近日上线全场景 AI 创意工作室 Miora,面向设计师、内容创作者和营销团队提供从创意构思到成品交付的一站式设计能力。目前平台已开启国际版邀测,用户需要申请邀请码后才能进入体验。
Miora 由腾讯 CodeBuddy、WorkBuddy 团队打造,采用面向创意设计场景定制的智能体架构。用户只需输入一句自然语言需求或一份设计 Brief,系统便会自动拆解任务、调用不同创作工具,生成图片、视频、UI/UX、3D 元素以及整套品牌视觉材料。
与常见的单张 AI 绘图工具相比,Miora 更强调完整工作流。平台可以围绕同一个项目持续生成和修改内容,支持局部编辑、尺寸扩展、背景移除和视觉方案调整,并将不同类型的素材集中在同一个创作画布中。
Miora 还加入了持久记忆能力,可以记录用户的审美偏好、品牌规范和项目上下文。随着使用次数增加,生成结果会逐渐贴近用户常用的设计语言,减少重复上传参考素材和反复描述风格的过程。腾讯称,该能力可以帮助团队在不同品牌与营销项目中保持视觉一致性。
腾讯将 Miora 定位为具备记忆能力的智能体创意工作室。官方宣称,平台能够将原本需要数周完成的创意制作流程压缩至数小时,但实际效果仍取决于项目复杂度、生成模型质量以及后期人工调整。
体验地址:https://miora.design/home
频道 @AppDoDo 官推 APPDOTG
OpenAI 宣布全新的 ChatGPT 桌面应用现已在全球范围内推出,支持 macOS 和 Windows 系统。它将 Chat(用于提问和对话)、Work(用于研究和交付成果)以及 Codex(用于软件开发)功能整合到一个应用中。
在桌面端,Work 可以在获得您的许可后使用本地文件和桌面应用程序。内置浏览器使 ChatGPT 能够从网站收集信息,并与受支持的基于 Web 的工具和文件配合使用。Codex 还增加了差异对比中的内联编辑、侧边栏中的拉取请求审查、更快的计算机使用速度以及对单个项目中多个代码库的支持。
如果您已在使用 Codex 应用,请按常规方式更新以迁移到新的 ChatGPT 桌面应用。如果您使用的是旧版 ChatGPT 桌面应用,请按照应用内的提示下载新版本。旧版应用可以保留,名称为 ChatGPT Classic。ChatGPT Classic 将继续获得模型更新、错误修复、安全补丁以及对其现有企业功能的支持,而 Work 和 Codex 等新的 Agent 功能则在新应用中提供。
此外,ChatGPT Atlas 浏览器将于 8 月 9 日被终止。在此之前,请导出或保存任何重要的 Atlas 数据,包括您想要保留的书签和页面。在此之后,Atlas 可能无法再打开、浏览或支持基于浏览器的代理工作流程。如需更深入的 Agent 浏览器操作,请尝试使用全新的 ChatGPT 桌面应用程序。它旨在支持 ChatGPT 中更强大的基于浏览器的 Agent 工作流程,包括多标签页、下载、改进的导航、账户登录支持以及其他相关的浏览器改进。如需在 Chrome 浏览器中使用,请尝试使用 ChatGPT Chrome 扩展程序或侧边栏。
via 匿名
聪明人的分工:让昂贵模型做规划,便宜模型去执行
知名开源开发者 shadcn 刚刚开源了一个全新项目——improve。
这是一个非常巧妙的 Agent Skill,它的核心理念是:用你最聪明(也最昂贵)的 AI 模型来做高杠杆的脑力劳动(审计代码、写技术方案),然后把脏活累活(编写代码、跑测试)交给更便宜的 AI 模型去执行。
这个工具本身绝对不会直接修改你的一行代码,它的产出就是一份清晰、可执行的 Markdown 格式实施方案。
💡 它是如何工作的?
1. 项目审计 (
2. 制定方案 (
3. 分发执行 (
🚀 核心指令一览
•
•
•
•
•
安装方式
项目支持 Agent Skills 规范:
https://github.com/shadcn/improve
#AI开发 #智能代理 #软件工程 #GitHub开源 #shadcn
知名开源开发者 shadcn 刚刚开源了一个全新项目——improve。
这是一个非常巧妙的 Agent Skill,它的核心理念是:用你最聪明(也最昂贵)的 AI 模型来做高杠杆的脑力劳动(审计代码、写技术方案),然后把脏活累活(编写代码、跑测试)交给更便宜的 AI 模型去执行。
这个工具本身绝对不会直接修改你的一行代码,它的产出就是一份清晰、可执行的 Markdown 格式实施方案。
💡 它是如何工作的?
1. 项目审计 (
/improve):高阶模型会深度扫描并分析你的代码库,指出潜在的 Bug、性能瓶颈、安全隐患或技术债,并产出一份按“投入产出比”排序的发现清单。2. 制定方案 (
plans/):当你挑选出需要解决的问题后,高阶模型会针对每个问题输出一份极其详尽的方案(Plan)。这些方案是“自包含”的,带有明确的验证命令、执行边界和异常中止条件(STOP conditions)。3. 分发执行 (
/improve execute <plan>):你可以把这些高可读性的方案直接扔给任何便宜的轻量级 AI Agent。轻量级模型只需像个机械的执行者一样,按照步骤修改代码、运行测试,最后向你提交 Pull Request。🚀 核心指令一览
•
/improve:全局审计并输出优化点。•
/improve quick:快速扫描重点。•
/improve deep:对每个包、每个分类进行详尽审计。•
/improve plan <description>:跳过审计,直接为指定任务编写执行方案。•
/improve execute <plan>:派发给便宜的执行器模型并审核其成果。安装方式
项目支持 Agent Skills 规范:
npx skills add shadcn/improve
https://github.com/shadcn/improve
#AI开发 #智能代理 #软件工程 #GitHub开源 #shadcn
CodeGraph 是一个专为 Claude Code、Cursor、Codex、OpenCode 等 AI 编程 Agent 打造的预索引代码知识图谱工具。
它能让 AI 不再每次都通过 grep、read、explore 盲目扫描代码,而是直接查询一个语义化知识图谱,实现更快、更省、更准的代码理解与开发。
📮投稿 📢频道 💬吹水 🌐网站
这是一款提供全天候免提协助的智能眼镜,将于今秋上市。
新款音频眼镜可让 Gemini 随时为你提供帮助,比如拍照、在新城市导航,或将音频内容进行实时翻译。Audio Glasses支持与 Android 及 iOS 手机配对使用。
• Gemini 月活用户达9 亿
谷歌搜索现在由Gemini 3.5加持、具备大规模执行任务能力
该功能将先向 Google AI Pro 和 Ultra 订阅用户逐步推出
Google 推出CodeMender API,一种代码安全代理,可自动发现并修复关键的软件漏洞。
今天,我们将邀请一小部分精选专家来进行测试,并计划很快更广泛地推出。
面向科学的 Gemini,旨在加速科研进程
Gemini 已经可以帮助解决复杂问题,而我们全新的 GoogleLabs 原型还能进一步简化更多日常科研任务,包括:
• 跟进最新论文
• 把研究目标转化成可直接使用的代码
• 生成新的假设
AI 模拟是面向科学的中另一个强有力的工具,能够帮助我们理解并预测动态系统。
Google 推出Google Pics
Google Workspace 新增一款全新产品,让你获得更强的创作掌控力。
这是一款图像创建与编辑工具,几乎能帮你做出任何想要的作品——比如派对传单和信息图表。它会自动识别并分割照片中的各个对象,理解它们之间的关系,让你只需点击几下就能轻松完成编辑。
Pics 将于今天先向一小部分“可信测试员”开放,随后在今年夏天晚些时候,面向全球的 Google AI Pro 和 Ultra 订阅用户推出。
Stitch by Google现在能够实时生成移动端和 Web 应用的界面(UI)
今天起开始免费向全球用户逐步推出。
你可以让 Stitch 根据你的提示设计一款移动端应用,并通过语音和文字编辑备注对设计进行打磨——就像和设计伙伴协作一样。准备上线时,可将设计导入 Google Antigravity 或 GoogleAIStudio ,并进行发布。
Google Flow多项更新
• 新增Gemini Omni Flash:只需提供简短提示和风格参考,Gemini Omni 就能在保留原始性能的同时,改变现有场景的环境,添加视觉效果及其他元素。
• 新增Google Flow 代理:集成Gemini 的智能代理能力,现在你的智能体可以同时执行多个操作。该代理还能凭借对上下文的精准理解,完成大规模编辑任务。
• 新增Google Flow 工具:现在你可以为任何你想到的创意工具“尽情编写代码”,比如设计视频特效或手绘动画。你还能在Google Flow上直接创建、分享并对这些工具进行再创作(remix)。
• 新增Google Flow Music:还在脑海里挥之不去的旋律?现在你可以在 Google Flow Music 上创作自己的歌曲。你只要把即兴创作录进 Google Flow Music,并用你想要的音乐风格来给它下指令——比如更精致的 R&B。Google Flow Music 会先给你打好基础,之后你就能直接在这个工具里继续微调完善。
新增 Universal Cart(环球购物车),Google 上全新的购物中心
你可以在Google引擎、Gemini App、YouTube或Gmail购物时,将商品添加到购物车。
系统将查找优惠和降价信息,给你带来价格历史的洞察,并在某件商品重新上架时及时提醒你。
它能帮你发现隐藏的优惠。由于它是基于 Google 钱包打造的,你的购物车会识别你的支付方式特权、会员/忠诚度信息以及商家优惠,这样你就不会错过任何优惠或积分。
• 通用商务协议(Universal Commerce Protocol:一项开源标准,它为代理和系统提供共同语言,使所有关键参与者能够携手协作。
• Agent Payments Protocol(AP2):让你的 AI 代理在明确边界与责任的框架下,安全地替你完成支付。
• Android Halo: 为你的代理在 Android 设备上提供的全新空间。今年晚些时候,它将让你一眼掌握各个代理的状态,从屏幕顶部就能直接看到他们的进展。Halo 将支持与 Gemini Spark 及其他兼容的智能代理协同工作。
▎Codex 登陆 ChatGPT 移动端:可在 iOS 和 Android 上查看、审批和控制编程任务
OpenAI 将 Codex 接入 ChatGPT 移动端。用户现在可以直接在 iOS 和 Android 的 ChatGPT App 中查看和控制 Codex 任务,不必一直守在电脑前。OpenAI 称,移动端 Codex 会连接到正在运行 Codex 的设备或远程环境,包括笔记本、Mac mini 或托管远程环境,并同步当前线程、审批、插件和项目上下文。
这次更新的重点在“远程接管开发流程”。用户可以在手机上查看 Codex 的实时工作状态,检查代码输出、批准操作、切换模型、继续已有线程,也可以启动新的编程任务。The Verge 报道称,本地文件、凭据和环境仍保留在用户机器上,手机端主要接收实时状态、截图和测试结果等信息。
Codex 的使用场景从“坐在电脑前写代码”已经进一步扩展到“让电脑或远程环境继续跑任务,人在手机上审批和跟进”。对于经常使用 AI coding agent 的开发者来说,移动端的接入极大程度上方便了处理长时间构建、测试、修复和代码审查流程。
频道 @AppDoDo 官推 APPDOTG
Multica 的核心理念是把各种编码 AI Agent变成真正的团队队友。
不再需要手动复制提示词,而是像分配任务给同事一样,把 Issue 指派给 Agent,让它们自主执行、汇报进度、积累技能。
➡️ Agent 即队友:每个 Agent 有独立档案、出现在看板上、能发表评论、创建 Issue、主动报告阻塞,像人类同事一样协作。➡️ 完整任务生命周期管理:自主认领、执行、实时进度推送(WebSocket)、完成/失败处理。➡️ 可复用技能系统:Agent 每次解决的问题都会变成团队共享的“技能”,让团队能力随时间持续增长。➡️ 多 Agent 多 Runtime 支持:兼容 Claude Code、OpenAI Codex、GitHub Copilot CLI、OpenClaw、OpenCode、Hermes、Gemini、Pi、Cursor Agent、Kimi、Kiro CLI 等,几乎覆盖主流编码 Agent。
📮投稿 📢频道 💬吹水 🌐网站
GPT-5.5 今天已在 ChatGPT 和 Codex 上向 Plus、Pro、Business 与Enterprise用户开放推出。
我们还在 ChatGPT 中向 Pro、Business 和 Enterprise 用户提供了 GPT-5.5 Pro。
一种面向实际工作的全新智能类型,为智能代理赋能——能理解复杂目标、使用工具、核验结果,并把更多任务彻底完成。它代表着完成计算机工作的全新方式。
GPT-5.5 在编写和调试代码、在线研究、分析数据、创建文档和电子表格、操作软件以及在工具间切换直到任务完成方面表现出色。
在真实应用场景中,GPT-5.5 的每token延迟与 GPT-5.4 相当,但在我们所做的几乎所有评测中都表现更优。
在完成相同 Codex 任务时,它使用的 token 明显更少,因此不仅更高效,表现也更出色。
在 ChatGPT 中的全栈推理改进让模型在更快的速度下具备更强的能力。
▎OpenAI 推出 GPT‑5.5,迄今为止最强的代理编码模型
OpenAI 于 2026 年 4 月 23 日正式发布 GPT-5.5,并将其定位为“面向真实工作的新一类智能”。官方表示,GPT-5.5 在理解复杂任务意图、跨工具持续执行、检查结果以及完成多步骤工作方面更强,重点能力覆盖写代码、在线研究、数据分析、生成文档与表格、操作软件等场景。
在编程能力方面,OpenAI 给出的数据称,GPT-5.5 在 Terminal-Bench 2.0 上达到 82.7%,在 SWE-Bench Pro 上达到 58.6%,并在其内部用于长周期编程任务评估的 Expert-SWE 上继续领先 GPT-5.4。官方认为,这意味着它在复杂命令行流程、真实 GitHub issue 修复、跨大规模代码库保持上下文、处理模糊故障和调用工具验证假设等方面更强。
在知识工作场景中,OpenAI 表示 GPT-5.5 在 Codex 里生成文档、表格和幻灯片的表现优于 GPT-5.4。公司内部团队已将其用于演讲请求分析、税务材料审阅和业务周报自动化等任务。官方还称,目前 OpenAI 内部已有超过 85% 的员工每周使用 Codex,涉及软件工程、财务、传播、市场、数据科学和产品管理等岗位。
GPT-5.5 已开始向 ChatGPT 和 Codex 的 Plus、Pro、Business、Enterprise 用户推出,GPT-5.5 Pro 则面向 Pro、Business、Enterprise 用户开放。OpenAI 同时表示,API 部署需要额外安全措施,正在与合作伙伴推进,GPT-5.5 和 GPT-5.5 Pro “很快”也会进入 API。
频道 @AppDoDo 官推 APPDOTG
Huashu Design - 一个专为 Claude Code / Cursor / Codex 等 AI 编码代理设计的 HTML 原生设计 Skill
开发者(小猫补光灯作者)声称逆向了「Claude Design」,并做成了一个 Skill。
这是一个内置了 20 条设计哲学 + 5 维专家评审 + 品牌资产协议 + 动效引擎的完整设计工作流。
看效果倒是非常不错,所以推荐之。实际体验不知道(暂时没token了),毕竟自媒体很多时候是噱头大于实际价值的。
📮投稿 📢频道 💬吹水 🌐网站
Karpathy 最近在 X 上分享了他用 LLM 来管理个人知识库的方法[Link],这个帖子很快爆火,核心思路是把 LLM 当成知识编译器,而不是单纯的问答工具或代码生成器。
MindOS 就是把 Karpathy 的思路完全产品化,核心理念是人类负责思考、审视和演化想法,AI Agents 负责执行任务、反思并提炼标准操作流程(SOP)
直接将这句话发给 Agent 就可以开始了:
帮我从 https://github.com/GeminiLight/MindOS 安装 MindOS,包含 MCP 和 Skills,使用中文模板。📮投稿 📢频道 💬吹水 🌐网站
Claude Sonnet 4.6 是我们目前最强大的 Sonnet 模型,对编码、电脑操作、长上下文推理、智能体规划、知识类工作和设计能力都进行了全面升级。Sonnet 4.6 还在测试阶段支持 100 万token的上下文窗口。
价格与 Sonnet 4.5 相同,起价为每百万token $3 输出/ $15 输出。
对于我们的免费和Pro计划用户,Claude Sonnet 4.6 现已在 claude.ai 和 Claude Cowork 中设为默认模型。