{"slug": "top-ai-papers-on-hugging-face-2026-07-22", "title": "Top AI Papers on Hugging Face - 2026-07-22", "summary": "Hugging Face's top AI papers on July 22, 2026, highlight trends in agentic systems, world modeling, multimodal understanding, video generation, and tooling. Notable papers include TimeLens2 for video temporal grounding using multimodal LLMs, DeepSearch-World for verifiable LLM agent search, and EvolvingWorld for co-evolving role-playing agents.", "body_md": "Hôm nay, bảng xếp hạng paper trên Hugging Face cho thấy một bức tranh khá rõ về xu hướng AI hiện tại: **agentic systems**, **world modeling**, **multimodal understanding**, **video generation/personalization**, và **tooling cho code/data pipeline** đang tăng tốc rất mạnh.\n\nTrong bài viết này, mình sẽ đi qua 10 paper được upvote cao nhất hôm nay, và với mỗi paper sẽ trả lời 4 câu hỏi ngắn gọn:\n\n`2607.17423`\n\nVideo temporal grounding là bài toán xác định **đoạn thời gian trong video** tương ứng với một mô tả ngôn ngữ, ví dụ: “lúc người đàn ông mở cửa rồi bước vào phòng”. Đây là tác vụ quan trọng cho tìm kiếm video, giám sát, và trợ lý đa phương thức.\n\nTimeLens2 hướng tới một mô hình **generalist**, tức không chỉ làm tốt một dạng temporal grounding cố định mà có thể xử lý nhiều kiểu truy vấn khác nhau nhờ **Multimodal LLMs**. Thay vì xem grounding như một tác vụ hẹp, paper tận dụng khả năng hiểu ngữ cảnh, chuỗi sự kiện và quan hệ thời gian của MLLM.\n\nĐiểm đáng chú ý là cách paper đặt temporal grounding vào khuôn khổ **đa nhiệm, đa dạng truy vấn**, giúp mô hình tổng quát hóa tốt hơn trên nhiều loại mô tả. Điều này phản ánh xu hướng mới: dùng MLLM như một “bộ suy luận thời gian” thay vì chỉ là encoder cho video.\n\n`2607.07820`\n\nLLM agent làm search thường gặp vấn đề: tìm được thông tin nhưng **khó đảm bảo đúng**, khó đánh giá chuỗi suy luận và hay “đi lạc” trong không gian tìm kiếm.\n\nDeepSearch-World đưa agent vào một **môi trường có thể kiểm chứng được** (verifiable environment), nơi kết quả tìm kiếm, hành động và trạng thái có thể đánh giá rõ ràng. Từ đó, hệ thống dùng **self-distillation** để agent tự học từ các trajectory tốt của chính mình.\n\nThay vì chỉ fine-tune từ dữ liệu tĩnh, paper nhấn mạnh việc để agent học trong **một thế giới có feedback xác minh được**. Đây là hướng rất quan trọng vì một trong những điểm nghẽn lớn nhất của AI agent là thiếu tín hiệu huấn luyện đáng tin cậy cho planning và search.\n\n`2607.17250`\n\nTrong môi trường nhập vai tương tác, nhân vật AI thường thiếu **tính nhất quán dài hạn**, còn thế giới xung quanh lại ít thay đổi theo hành động của agent. Kết quả là trải nghiệm role-play dễ trở nên hời hợt.\n\nEvolvingWorld đề xuất một framework **co-evolving**: agent nhập vai và world model cùng tiến hóa theo thời gian. “Open-schema” cho thấy cấu trúc thế giới không bị đóng cứng, mà có thể mở rộng khi câu chuyện phát triển.\n\nĐiểm mới cốt lõi là không coi nhân vật và thế giới là hai thành phần tách biệt. Paper xem chúng như **hai hệ thống đồng phát triển**, nơi ký ức, trạng thái, quan hệ và sự kiện được cập nhật liên tục.\n\n`2607.18213`\n\nTrong software engineering agents, một vấn đề lớn là context quá rộng: repo lớn, nhiều file, nhiều dependency. Nếu đưa toàn bộ codebase vào ngữ cảnh thì vừa tốn token vừa làm mô hình nhiễu.\n\nPaper đưa ra giả thuyết thú vị: **coder LLM vốn đã có khả năng nhận biết phần nào của code cần loại bỏ**. Thay vì phụ thuộc hoàn toàn vào retrieval phức tạp hay heuristic thủ công, có thể khai thác trực tiếp tri thức tiềm ẩn của model để “prune” context.\n\nĐiểm mới ở đây là thay đổi góc nhìn: không xem pruning là bước tiền xử lý độc lập, mà là một năng lực có thể **nằm sẵn trong coder LLM**. Nếu đúng, điều này có thể làm nhẹ đáng kể stack của SWE agents.\n\n`2607.14183`\n\nEmbodied AI và robot manipulation đang thiếu các bộ dữ liệu mở, đủ lớn và đủ chuẩn để học từ góc nhìn **egocentric** — tức góc nhìn của chính tác nhân thao tác.\n\nOpen-AoE giới thiệu một **dataset và toolchain mở** dành cho thao tác hiện thân. Giá trị không chỉ nằm ở dữ liệu mà còn ở hệ công cụ để thu thập, chuẩn hóa, huấn luyện và đánh giá.\n\nPaper đi theo hướng hạ tầng: tạo một “open ecosystem” cho embodied learning. Đây là thứ thị trường rất cần, vì nhiều tiến bộ robot hiện nay bị giới hạn bởi dữ liệu đóng hoặc pipeline khó tái lập.\n\n`2607.18703`\n\nWorld generation rất hấp dẫn, nhưng điểm nghẽn là **tốc độ render**. Nếu không đủ nhanh, hệ thống khó dùng trong game tương tác hoặc simulation thời gian thực.\n\nPaper tập trung vào một **generative renderer** đủ nhanh để đạt “speed of play”, tức tốc độ đủ cho tương tác liên tục như đang chơi game. Đây là bước chuyển từ demo tạo nội dung offline sang hệ thống có thể vận hành online.\n\nĐiểm mới nằm ở việc tối ưu hóa để mô hình sinh thế giới không chỉ đẹp mà còn **real-time hoặc near-real-time**. Trong làn sóng world model, đây là năng lực then chốt để đi từ nghiên cứu sang sản phẩm.\n\n`2607.16617`\n\nXây dựng data pipeline bằng LLM agent thường thiếu tính **grounded**, khó chỉnh sửa và khó bảo trì. Agent có thể sinh code chạy được, nhưng biến thành pipeline thực sự dùng được trong tổ chức là chuyện khác.\n\nDataFlow-Harness giới thiệu một nền tảng để code agent xây dựng các **LLM data pipelines có thể chỉnh sửa**. Từ “grounded” gợi ý rằng mọi bước được liên kết với cấu trúc, dữ liệu và hành vi thực tế thay vì chỉ sinh code tự do.\n\nĐiểm khác biệt là nhấn mạnh vào **editable pipelines**. Đây là một chi tiết cực kỳ thực dụng: trong doanh nghiệp, pipeline cần con người vào chỉnh, audit, và mở rộng. Một hệ thống “agent-native” nhưng vẫn “human-editable” có giá trị rất lớn.\n\n`2607.18217`\n\nVideo personalization thường mới dừng ở chỉnh màu, style hoặc cắt ghép đơn giản. Nhưng để cá nhân hóa thật sự, hệ thống phải hiểu **con người**, **đối tượng**, và tương tác giữa chúng.\n\nHOMIE xây dựng hướng cá nhân hóa video theo trục **human-object centric** với hỗ trợ đa phương thức. Nghĩa là mô hình không chỉ “làm đẹp” video mà còn hiểu ai là chủ thể chính, vật thể nào quan trọng, và nên tăng cường phần nào.\n\nĐiểm mới là kết hợp personalization với **cấu trúc ngữ nghĩa của video**, đặc biệt xoay quanh người và vật thể. Đây là hướng hợp lý vì phần lớn nhu cầu video tiêu dùng đều liên quan đến giữ nổi bật chủ thể chính.\n\n`2607.19139`\n\nDiffusion Transformers ngày càng mạnh, nhưng cách chúng mã hóa ngữ nghĩa từ prompt vẫn khá “hộp đen”. Ta biết prompt ảnh hưởng đến ảnh sinh ra, nhưng **ảnh hưởng đó được lưu ở đâu và như thế nào** trong mô hình?\n\nPaper cho rằng các **text template tokens** hoạt động như những **semantic registers ngầm** trong DiT. Tức là một số token không chỉ là từ ngữ đầu vào mà còn đóng vai trò như các “thanh ghi ngữ nghĩa”, giúp tổ chức và truyền tải thông tin khái niệm trong quá trình sinh ảnh.\n\nĐây là một đóng góp về **interpretability** rất thú vị. Thay vì chỉ đo attention hay activation theo cách chung chung, paper đưa ra một giả thuyết có cấu trúc hơn về vai trò chức năng của token trong DiT.\n\n`2607.18367`\n\nWorld model dài hạn là một trong những mục tiêu lớn nhất của AI hiện nay: mô hình có thể dự đoán, duy trì trạng thái và tạo ra diễn tiến hợp lý của môi trường qua nhiều bước tương tác.\n\nAlayaWorld nhắm tới **interactive long-horizon world modeling**, tức mô hình hóa thế giới trong các chuỗi tương tác dài, nơi hành động hiện tại ảnh hưởng đến trạng thái tương lai một cách nhất quán.\n\nĐiểm mới nằm ở quy mô tham vọng và trọng tâm vào **tính tương tác dài hạn**. Nhiều hệ thống sinh video/thế giới hiện nay làm tốt vài giây hoặc vài bước, nhưng rất khó giữ được coherence khi kéo dài. AlayaWorld đang đi thẳng vào nút thắt đó.\n\nNhìn toàn cảnh, có thể thấy 4 xu hướng rất rõ:\n\nCác paper như **DeepSearch-World**, **SWE-Pruner Pro**, và **DataFlow-Harness** cho thấy trọng tâm đang chuyển sang **agent workflow**: tìm kiếm, lập kế hoạch, chỉnh sửa code, xây pipeline.\n\n**EvolvingWorld**, **Generative World Renderer**, và **AlayaWorld** cùng chỉ về một đích: xây dựng các hệ thống AI có thể **mô phỏng và duy trì một thế giới tương tác** thay vì chỉ sinh đầu ra tĩnh.\n\n**TimeLens2** và **HOMIE** phản ánh nhu cầu rất thực tế: hiểu video sâu hơn, cá nhân hóa nội dung tốt hơn, và đưa khả năng ngôn ngữ vào các tác vụ video phức tạp.\n\n**Open-AoE** nhắc lại một điều quen thuộc nhưng hay bị bỏ quên: tiến bộ bền vững trong AI không chỉ đến từ model mới, mà còn từ **dataset, toolchain, benchmark và hệ sinh thái mở**.\n\nNếu phải tóm tắt ngắn gọn top 10 paper hôm nay, mình sẽ nói thế này:\n\nAI đang tiến nhanh theo ba hướng song song:\n\nhiểu tốt hơn thế giới đa phương thức,\n\nhành động tốt hơn trong workflow thực,\n\nvàmô phỏng thế giới ngày càng dài hạn, tương tác hơn.\n\nĐặc biệt, các paper về **world modeling** và **agentic systems** xuất hiện dày đặc cho thấy cộng đồng đang không còn hài lòng với những mô hình chỉ “nói hay”. Mục tiêu mới là các hệ thống có thể **theo dõi trạng thái, đưa quyết định, chỉnh sửa, kiểm chứng, và tương tác liên tục**.\n\nNếu bạn làm trong một trong các mảng sau:\n\nthì danh sách hôm nay có rất nhiều tín hiệu đáng theo dõi.\n\nNếu muốn, ở tin nhắn tiếp theo mình có thể làm thêm một trong 3 việc sau:", "url": "https://wpnews.pro/news/top-ai-papers-on-hugging-face-2026-07-22", "canonical_source": "https://dev.to/y_hnhnhan_2f26de65ffcc4/top-ai-papers-on-hugging-face-2026-07-22-5je", "published_at": "2026-07-22 12:01:36+00:00", "updated_at": "2026-07-22 12:30:30.567374+00:00", "lang": "en", "topics": ["artificial-intelligence", "large-language-models", "computer-vision", "ai-agents", "ai-research"], "entities": ["Hugging Face", "TimeLens2", "DeepSearch-World", "EvolvingWorld", "Open-AoE"], "alternates": {"html": "https://wpnews.pro/news/top-ai-papers-on-hugging-face-2026-07-22", "markdown": "https://wpnews.pro/news/top-ai-papers-on-hugging-face-2026-07-22.md", "text": "https://wpnews.pro/news/top-ai-papers-on-hugging-face-2026-07-22.txt", "jsonld": "https://wpnews.pro/news/top-ai-papers-on-hugging-face-2026-07-22.jsonld"}}