llama.cpp b11418:server 支援 Clef 視覺輸入
llama.cpp 發布建置 b11418,其 server 新增對 Clef 的視覺輸入支援(PR #29969),並修復影像 token 上限、abort 與 yield_to_queue 資料變更等問題。
依意思最接近的 6 筆
llama.cpp 發布建置 b11418,其 server 新增對 Clef 的視覺輸入支援(PR #29969),並修復影像 token 上限、abort 與 yield_to_queue 資料變更等問題。
OpenAI 宣布在 ChatGPT 推出新的視覺廣告格式,並擴充套件廣告測量工具與合作伙伴。該格式初期在影像生成過程中測試,廣告會明確標註且與生成的圖片分開,不影響 ChatGPT 給出的回答,本月晚些時候在美國面向首批廣告主開始。ChatGPT 每週觸達 12 億人。OpenAI 同時接入 Hightouch、Tealium、LiveRamp 的轉化資料整合,與 AppsFlyer、Adjust 等歸因夥伴合作,並與 DoubleVerify、IAS 試點品牌適配性評估。
OpenAI 把視覺展示廣告加入 ChatGPT 廣告產品線,廣告會與使用者要求生成的圖片一同出現。該廣告本月晚些時候先在美國上線,來自首批測試廣告主,帶有明確標註且不會影響 ChatGPT 給出的回答。OpenAI 同時擴充套件廣告測量工具與合作伙伴,涵蓋 AppsFlyer、Adjust 等點選歸因方案,並與 DoubleVerify、Integral Ad Science 開展品牌適配性評估試點。
OpenAI 將於本月晚些時候在美國開始測試新的視覺廣告,在 ChatGPT 生成圖片時展示贊助商品的圖片。廣告與生成的圖片分開顯示,OpenAI 稱不會影響 ChatGPT 給出的回答。OpenAI 今年 2 月首次在 ChatGPT 投放廣告,此前廣告只顯示公司名、logo 和產品連結,位於對話下方的 sponsored 區域。訂閱 Plus、Pro 等方案的使用者不會看到廣告。
何愷明團隊發布 NAT-ARC,用 ImageNet 上 MAE 預訓練的視覺編碼器解 ARC 抽象推理題,最佳單模型(0.6B 引數)在 ARC-1 上 pass@2 達 63.4%,整合後 70.2%。該方法不依賴 LLM,預訓練階段不使用 ARC 格子,僅複用 MAE 公開 checkpoint,測試時對每題做 LoRA 微調。論文稱這是純視覺方案首次逼近專用 LLM 系統水平,並顯示預訓練打通了視覺路線的 scaling 瓶頸。
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。