Open Minis:我期待的Siri AI智能体已经在iOS上实现
偶尔,我会遇到一款第三方应用,它要么重置了我对iOS特定软件类别的期望,要么创造了一个全新的类别。在我为MacStories撰写应用评论的17年里,这样的时刻有不少:Editorial、Workflow、Obsidian、Sky,以及最近的OpenClaw都浮现在脑海中。过去几周,我又一次经历了这样的时刻,这次是Open Minis,一款适用于iPhone和iPad的新聊天机器人应用,我最好的描述是:它让我们今天就能预览Siri AI的智能体未来。
Open Minis是一款设备端智能体,让你可以使用任何前沿模型进行对话,但有一个特点:与其他AI封装器不同,这款应用通过第三方开发者可用的官方API,深度集成了各种原生苹果系统框架。Open Minis可以控制提醒事项和音乐(我们之前见过),还可以控制日历、地图、HomeKit、HealthKit和文件;它甚至能与Vision(用于OCR)、Apple NLP(用于自然语言处理)、iOS剪贴板、语音识别与听写、NFC和蓝牙等框架配合使用。此外,Open Minis在文件应用中拥有自己的可配置工作区,具有设备端记忆系统,并通过内置的WebKit网页视图(再次强调,这是iOS开发者的原生功能)具备浏览器使用能力。
实际上,Open Minis就像是把Claude Code和OpenClaw融合成一个为苹果用户设计的直观智能体体验,并配备了一个强大的工具调用框架,可以自我改进和调整,同时专门为苹果生态系统设计了集成。这是我一段时间以来见过的最令人印象深刻的独立应用。如果你对Siri AI缺乏高级用户功能感到失望,那么这就是一个真实的、正在出货的例子,展示了如果Siri AI由真正具备智能体功能的前沿模型驱动,它本可以成为什么样子。
iOS CLI
Open Minis暗藏的妙招既巧妙又显而易见:它支持的所有苹果框架集成都由命令行界面(CLI)驱动,这些CLI将原生苹果API(EventKit、MusicKit、HomeKit等)连接到现代LLM能够理解和操作的代码环境。为了让这一切在幕后工作,Open Minis的开发者必须为每个框架创建专用的CLI,而这些CLI(另一个妙招)由一个模型框架驱动,该框架可以访问内置的Linux终端,并被沙盒化到应用的工作区中。
具体来说,Open Minis运行一个iSH版本,这是一个流行的Alpine Linux shell,它以沙盒方式为ARM64架构操作一个持久的、模拟的Linux环境。Open Minis内部的shell可以使用Alpine的apk包管理器从网络下载外部包(这意味着你可以直接从应用访问ffmpeg和yt-dlp等流行工具),拥有自己的Linux文件系统(在文件应用中作为原生文件提供位置暴露),并且可以调用桥接的苹果CLI以及任何类型的MCP服务器(通过MCP代码执行,这也是当前AI行业的另一个趋势)。这样想:如果Mac上的Claude Code或Codex可以凭借在终端应用中运行而跨越整个文件系统做任何事情,那么Open Minis可以通过内置的终端模拟器在其应用沙盒内做(几乎)任何事情——包括运行Python、使用Git和SSH、以及访问标准的Unix文本工具。
然而,这并不意味着在使用Open Minis时,你会一直盯着终端界面:底层shell只是让这一切在幕后成为可能。应用可以显示一个画中画终端预览,你可以打开它来预览正在做什么,但你不必这样做。应用的主要界面是你经典的、聊天机器人风格的UI,根据你使用的模型,它会在对话记录中交错显示思考块、工具调用和消息。
Open Minis的另一个隐藏力量(让人想起OpenClaw,或者更准确地说,一个像Hermes Agent这样的自我改进系统)是它可以通过专用的Minis CLI检查和修改自己的 workspace。例如,你可以用自然语言要求Minis添加一个新模型或MCP服务器,应用会弹出一个原生设置屏幕并要求权限。如果你想存储密码或API令牌,应用不会以纯文本形式存储:它会显示一个基于钥匙串的原生页面,你可以在其中安全地存储凭据。更重要的是,Minis自身的CLI用于通过应用的记忆系统(基于Markdown文件)回忆之前的对话、创建技能以及回答关于应用本身的问题。例如,当我要求Minis描述它为iOS用户提供了哪些苹果CLI时,它愉快地提供了完整指南:
或者当我要求回忆当天我们共同处理的所有事情时,Minis使用其一个CLI读取之前聊天的转录(再次强调,这些只是存储在文件应用中),回忆记忆,并向我呈现一个有用的所有完成任务的摘要。
为Minis添加新功能也是如此。由于它运行一个可以访问Python的Linux shell,并且可以将资产存储在持久的文件工作区中,我想我可以通过给Minis提供我的GitHub仓库链接,让Minis为自己安装我自己的Apple Frames CLI。GPT-5.6 Sol(我在应用中使用的模型)毫不犹豫:它找到了Frames CLI的所有依赖项,安装了它们,拉取了CLI的官方技能,一分钟后就可以使用了。而且由于Minis还带有原生的照片集成,我能够要求:
抓取我最新的三张截图,随机化它们的边框颜色,合并它们,并将图像保存到我的临时文件文件夹中。
几秒钟和苹果CLI调用之后,Minis将生成的带边框图像保存到我选择的文件夹中。能够在Minis沙盒之外的文件应用中的任何文件夹中工作是另一个该应用正在利用的官方iOS API;我们多年前首次在Working Copy中看到从文件应用“挂载”特定文件夹的能力,后来这个功能被Ulysses、iA Writer、MWeb和其他基于文档的应用采用。在Open Minis中,你可以从文件应用中的任何文件提供位置书签任何文件夹,并告诉你的智能体将文件保存到那里或从那里读取。
这对我来说感觉像魔法,但这只是当将大型、强大的模型与iOS和iPadOS比想象中更开放、更安全的本质相结合时,可能实现的众多例子之一。
在iOS上使用Open Minis
所有这些一开始都让人难以理解,而且不可否认,Open Minis是一个面向像我这样喜欢使用前沿模型并生活在AI最前沿的用户的高级工具。但在这个案例中,不同之处在于,Open Minis与其他应用不同,它拥抱了其苹果优先的本质,完全支持苹果制造、向第三方开发者发布、而Siri AI目前根本没有使用的技术。
“评论”一款AI聊天机器人应用是不可能的,因为每个人的使用场景都如此不同,但我还是要描述几个场景,希望能让你了解——也希望重置你的期望——通过一个深度集成iOS的AI可以实现什么。
首先,你可以在Open Minis中使用任何你想要的模型,包括最新的GPT-5.6模型、Claude Fable、OpenRouter的任何模型等等。(我甚至要求Open Minis为我们自己的OpenAI API创建一个代理,运行在我的Mac Studio上,这样我就可以在快速模式下使用Sol;它成功了!)你可以按键盘上方的/按钮来触发推理级别、压缩、记忆和技能;你也可以从应用设置中创建模型组、模型默认值和子智能体,然后要求模型为特定任务使用一组特定的子智能体,它会照做。
用这个概念来接近这个应用:几乎关于它的一切都是开放的,并且只需通过对话就可以配置。除了重写应用代码本身之外,你可以要求Open Minis调整关于自身及其设置的几乎所有事情,智能体就会执行。就个人而言,我认为对于这类事情,这是一个比OpenClaw更有效、更优雅、更稳定的框架。尽管应用的UI可以改进(我不喜欢推理选择器,我希望可以默认折叠思考步骤),但通过与模型对话来调整Minis的工作区以符合你的喜好是非常有趣的。事实上,你可以直接做事。
几天前,我好奇公寓里温度和湿度的状态。于是我要求Minis:
给我一份关于我家温度和湿度状态的简明报告,以漂亮的表格呈现。
一个原生的HomeKit权限提示和几分钟后,Minis中的Sol解析了每个传感器的原始温度和湿度读数,审查了HomeKit中配置的每个房间,并呈现了结果。相比之下,Siri AI呈现了……一些东西:
我还想到,将Open Minis中的照片集成与Siri AI的相册访问进行比较会很酷。理论上,它们都使用相同的框架,每张照片都有相同的元数据,但Siri AI还可以访问“个人上下文”,对吧?所以,我要求:
根据我的照片,你会说我最近在度假吗?
让结果自己说话:
那么HealthKit呢?再次强调,请记住Open Minis没有使用任何“黑客”或变通方法;它只是访问所有开发者都可以使用的相同原生苹果API和框架。我要求:
找到我最近度假时拍的一张大型船只的照片。那天晚上我走了多少步?
Minis开始以不同的方式思考这个请求:它首先检查了记忆,意识到我们最近讨论过我的度假,所以它可以直接短路寻找那些日期的过程。然后,它开始按日期过滤我的照片,找到了Palinuro船只的原始照片,然后……是的:
检查请求中的思考步骤也是一次有趣的练习,看看一个由出色iOS框架驱动的前沿模型如何推理出这类问题。模型——使用“Minis计算机”(即前面提到的Linux shell)——从文件应用中获取记忆作为Markdown文件,调用苹果照片CLI,组装一个包含照片网格的联系表,选出两个候选,选择最佳照片,分离日期,为该日期调用HealthKit,然后才构建答案。由于所有这些都是基于在设备上执行的决定性代码,响应迅速且不包含任何幻觉。
然后我决定更进一步:我要求Minis从我最近的度假照片中提取亮点,将它们放在由苹果MapKit JS驱动的地图上,并创建一个漂亮的、交互式的HTML制品,在地图上显示照片。我为此使用了Kimi K3。Minis首先要求我安全存储MapKit开发者令牌,然后开始工作。它收集照片并解析由照片应用返回的元数据,几分钟后,它出现了:
请注意HTML制品本身是如何通过WKWebView呈现的——这是另一个原生苹果框架,允许Minis的智能体使用与iOS上其他网页应用相同的WebKit渲染引擎显示网页。我还将网页视图与Apple NLP相结合,这是作为另一个CLI可供Minis使用的自然语言处理框架。我要求应用从MacStories获取我最近的iPad文章,通过Firecrawl将其抓取为Markdown,用Apple NLP标记其不同词性,并漂亮地呈现出来。没问题:
音乐在Open Minis中也是一等公民:通过与Apple Media框架集成,智能体可以查看你的音乐库中的内容,并找到你保存的专辑、歌曲和艺术家的信息。这意味着,如果我要求Minis……
我的库中有哪些Oasis单曲和B面曲?
……Minis可以检查我的库,与网络交叉引用结果,去重匹配,并以Siri AI目前无法做到的方式呈现结果,因为它的能力有限,而且模型无法在任何特定查询上长时间推理:
我可以继续说下去。Open Minis可以访问原生蓝牙框架,扫描附近的蓝牙LE设备,并找出细节:
它可以在完成任务时向你发送真实的通知,你甚至可以编程这些通知使其具有自定义标题和正文:
该应用还可以访问你当前的位置,从日历事件中提取位置,并使用原生苹果天气API给你详细的天气预报:
我想你明白了。
通过将智能推理模型与苹果平台上的广泛集成相结合,Open Minis可以在iOS上提供无与伦比的智能体体验,这同时也为高级用户展示了Siri AI未来的潜力。因此,虽然我仍然享受Siri AI作为一个比之前更强大的基本语音助手,但我已经完全用由GPT-5.6 Sol或Kimi K3驱动的Open Minis取代了其基于文本的聊天机器人功能。
iOS智能体正在到来
讽刺的是,在Siri AI即将在几个月内向数百万用户仅提供英文版之际,这里有一个独立的开发者正在发布一款应用,在iPhone和iPad上使用LLM完成工作方面,它让Siri AI相形见绌——使用你想要的任何模型,在任何语言或地区。
在未来几个月,我预计会有更多的开发者推出与Open Minis相当(甚至可能超越)的产品,基于相同的设备端智能体框架理念,将LLM与iOS特定集成相结合。一个值得关注的是Halo,一款来自Tanmay Sonawane的即将推出的iOS智能体,旨在将LLM、iOS集成、记忆和基于Andrew Karpathy在AutoResearch方面的开创性工作的主动功能,结合在优雅的iPhone原生体验中。我参与了Halo的早期测试组,这是一款非常有前途的产品,与Minis不同,它在设备上以循环方式运行(通过实时活动显示),以收集关于你对话、即将到来的任务和事件等的见解。
正如我几个月前所写,我很惊讶没有大型AI实验室在更深入地探索这个领域。正如Open Minis所证明的,既然模型在长时间运行任务和工具调用方面已经变得非常强大,那么确实有理由构建能够以几乎零成本访问iOS文件系统、照片和日历等应用以及Vision OCR、位置和语音转文本等技术的智能体。你能想象一个“真正的”Codex或ChatGPT Work for iPhone and iPad,配备类似Open Minis的系统以及驱动OpenAI模型的智能体循环和框架,会是什么样子吗?Anthropic可以用由Fable驱动的Claude Cowork做什么,它可以访问文件应用、运行CLI,并在设备之间同步你的工作区文件?
通过Siri AI,苹果终于推出了一款相当不错的聊天机器人,具有世界知识和个人上下文。Open Minis感觉像是iPhone上一整个新智能体应用类别的开始,像我这样的高级用户今天就可以开始依赖并将它们融入工作流程。