把語音指令轉換為瀏覽器操作
Moritz Kremb 在一段較長的教學中建立了語音控制瀏覽器。語音先被轉成文字,再由 Jev 從目前頁面元素中判斷使用者意圖對應的操作和目標。
Jev 只是整個循環中的一個環節。語音辨識、瀏覽器狀態、安全性檢查和實際點擊都在模型之外處理。
瀏覽來自 X 和 YouTube 的 Jev AI 產品功能、實驗與教學。每個案例都聚焦一項能運用在自己專案中的具體決策。
依照解決的問題瀏覽示範和實際產品案例。每則 X 貼文與 YouTube 影片都附有我們的說明,解釋 Jev 負責哪項具體決策。
正在顯示 25/25 個精選案例
Moritz Kremb 在一段較長的教學中建立了語音控制瀏覽器。語音先被轉成文字,再由 Jev 從目前頁面元素中判斷使用者意圖對應的操作和目標。
Jev 只是整個循環中的一個環節。語音辨識、瀏覽器狀態、安全性檢查和實際點擊都在模型之外處理。
Riley Brown 介紹了 Jev 的三種輸出形式,並展示了幾個小型應用程式,包括為請求選擇模型和對電子郵件進行分流。
先確定輸出格式:選擇一個選項、給出數值評分,或回答一個是非問題。如何根據結果採取行動,仍由應用程式負責。
TypeSafe 開發者關係負責人 Allie Laabs 參與 ThursdAI 訪談,講解 System One 模型以及 Choice、Score 和 Noul 三種能力。節目還包括貼文分類器和即時遊戲示範。
這段訪談提供了來自團隊的背景說明、示範和待討論問題。節目中提到的效能和價格資料屬於發言者的說法。
Gregor 展示了一個開源瀏覽器代理程式:它讀取 DOM 狀態和不斷變化的可用操作,由 Jev 選擇每一步;只有需要輸入文字時,才改用小型語言模型。
作者表示,機票搜尋範例約耗時 7 秒、成本 0.0039 美元。這只是示範數據,不應視為基準;操作執行和安全防護仍由應用程式負責。
Tamara 示範逐項評估工具呼叫並移除無關步驟,而不是用生成式摘要改寫需要保留的上下文。
逐項篩選可以保留入選內容的原文,但步驟之間的依賴關係和稽核要求仍需確定性檢查。
Aaron Levie 示範了一個 AI 代理程式:它讀取 Box 中的事故報告,判斷客戶是否受到影響並評估嚴重程度,再把檔案移入升級、監控或人工審查資料夾。
關鍵邊界在於簡短分類與執行分類結果的工作流程之間。移動資料夾和更新中繼資料仍由應用程式的程式碼負責。
在一段西班牙語示範中,Alan Daitch 將 Playwright 與 Jev 結合,用來審查二手商品資訊。Jev 判斷商品是否符合條件,周邊工作流程則負責略過、出價或向賣家詢問缺少的資訊。
作者在後續貼文中說明,系統會針對頁面文字進行五項是非判斷。頁面導覽、報價和聯絡賣家是另外的操作,需要獨立的審核規則與保護措施。
Rinte 的日語示範會根據目前談論的主題選擇相符的簡報投影片,演講者無需操作翻頁器或鍵盤。
這是從現有投影片中進行選擇的任務。語音擷取與投影片顯示屬於 Jev 周邊的應用程式功能;示範並沒有讓 Jev 產生投影片。
Kaneko 的日語原型會在每次發言後更新三組會議訊號:探索或收斂、已解決或待處理、存在分歧或達成共識。
重複執行範圍明確的判斷,可以讓即時討論更容易理解。這個原型只是視覺化工具,並不能證明這些標籤準確反映了每位參與者的真實意圖。
在一段中文示範中,Sac 將 Codex 與 Jev 結合,在 Mac 日曆中加入事件,並對照呈現使用與不使用 Jev 輔助流程時的相同任務。
並排影片直觀呈現了反應速度,但這只是單一作者的對比,並非受控效能測試。實際操作及其結果驗證仍由應用程式負責。
一段中文示範讓 Jev 處理涉及 15 個品牌的新聞流,為新聞分配結構化意圖標籤,並找出可能與各品牌相關的報導。
作者稱批次速度很快,但回覆中也有人指出明顯的分類錯誤。因此,在把結果用於公關決策前,仍需要編輯審核和可量化的準確率測試。
Nader 示範以意圖搜尋 Gmail,並指出面對大型收件匣時,可以先做語意檢索,再由 Jev 判斷較小的候選集合。
檢索與判斷是兩個獨立階段。郵件存取權限、候選召回率,以及檢查遺漏結果的方式仍然很重要。
Duncan 展示了一個路由器:先讓 Jev 判斷哪個模型適合目前的請求,再把請求傳送給該模型。Jev 負責路由判斷,另一個模型負責產生開放式回答。
範圍明確的選擇可以放在生成式模型之前。路由器仍需設定備援規則,並以真實請求進行評估。
Bannerbear 介紹了一項已經上線的功能:即使欄位名稱不同,也能把來源欄位配對到範本欄位,例如將 avatar 對應到 photo、將 full_name 對應到 name。
這是一個候選範圍固定的簡潔語意配對任務。產品仍應允許使用者檢查並修正建議的配對結果。
Nader Dabit 分享了一段預測型試算表示範:輸入「緊急程度」等欄位標題後,試算表會判斷每一列文字的含義,而不只是重新計算數字公式。
當所需的訊號來自語意時,評分可以擴展試算表的能力。這項示範仍是原型,其評分在投入實際業務前需要經過測試。
Marcel Pociot 示範了一款瀏覽器擴充功能:它會隱藏或折疊符合使用者自然語言規則的 X 貼文,並在使用者瀏覽時根據 Jev 回傳的判斷執行操作。
是非判斷可以讓個人內容過濾器即時回應。這裡的誤判影響很大,因此選擇可撤銷的「折疊」操作,比直接刪除內容更安全。
Marcel Pociot 展示了一款監控 macOS「下載」資料夾的應用程式。它判斷新檔案是否為發票,再依照設定規則歸檔並重新命名符合條件的文件。
作者表示,低信心檔案會留在原處等待人工檢查。合理的門檻和重複檔案偵測,比讓所有檔案自動移動更重要。
Hassan 展示了一條處理流程:先由 Jev 分類一批電子郵件,再把不確定的案例交給另一個模型,將快速初篩與更細緻的審查分開。
最重要的設計選擇是不確定性門檻。作者報告的準確率只適用於示範中的那批電子郵件,不能直接代表所有收件匣或詐欺模式。
Riley Brown 示範 Jev 在數秒內為 500 封郵件分類:系統從有限類別中選擇,而不是為每封郵件生成回覆。
作者表示該示範總成本約為 0.035 美元。投入正式環境前,仍需明確定義標籤、處理低信心結果,並由人工覆核重要郵件。
Paolo Rosson 把程式碼差異交給 Jev,得到一組關於潛在金鑰洩漏、SQL 注入、身分驗證變更、缺少測試及其他審查訊號的判斷。
這些結果只是審查提示,並不能證明程式碼可以安全合併。對於影響重大的改動,仍應保留人工審查及確定性掃描工具。
LangChain 從準確性、一致性、延遲和成本幾個面向比較 Jev 與語言模型評審器,探索評估代理程式行為的另一種方式。
只有當評分規則和標籤能反映團隊真正關心的行為時,更快的評審器才有價值。基準測試結論還應在各應用程式自己的資料上重現。
Hugo Duprez 示範由 Jev 輸出結構化決策,再由遊戲引擎在遊玩過程中據此建立下一段關卡。
Jev 只在遊戲預設的結構中選擇;有效幾何形狀、難度上限和可通過的銜接仍由引擎保證。速度數據來自作者自述。
Duncan 將迷宮狀態作為 JSON 發送,並讓 Jev 在 Pac-Man 到達岔路口時選擇方向,再由遊戲引擎即時執行這個範圍明確的決定。
遊戲能直觀展示重複且對延遲敏感的決策。這個示範說明的是控制迴圈,並不表示 Jev 可以直接看懂原始遊戲畫面。
Rob Hallam 展示了一段 SuperX 示範:系統針對每則貼文提出多項固定問題,再用答案對草稿排序。這說明評分可以輔助編輯,而不是替使用者產生貼文。
只有當排名與後續實際效果相關時,它才有價值。在獨立重現之前,應把作者公布的表現資料視為示範中的說法。
Stav Zilbershtein 示範如何依照顧客旅程階段和創意風格,將大型廣告庫分類,再用這些標籤分析競爭對手的廣告組合。
一致的標籤讓大型內容集合更容易比較。貼文中的耗時和成本均由作者報告;更深入的帳號分析屬於外圍工作流程,不一定是 Jev 的直接輸出。
先在 Playground 測試結構化決策,再到「專案」查看開源整合與範例。