benchmark
1,000 ofertas de empleo de benchmark en México. Encuentra ofertas actualizadas diariamente de los principales portales de empleo.
-
History PhD
Hace 6 días
naucalpan, estado de méxico Mercor Jornada completaAbout the job Mercor connects elite creative and technical talent with leading AI research labs. Headquartered in San Francisco, our investors include Benchmark, General Catalyst, Peter Thiel, Adam D'Angelo, Larry Summers, and Jack Dorsey. Position: Applied History & Political Science Benchmark Specialist Type: Contract Compensation: $44–$56/hour Location:...
-
iztapalapa, distrito federal, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
toluca, estado de méxico Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
cuautitlán izcalli, estado de méxico Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
cuernavaca, morelos, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
venustiano carranza, distrito federal, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
zapopan, jalisco, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
tláhuac, distrito federal, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
saltillo, coahuila, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
león, guanajuato, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
san pedro, coahuila, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
celaya, guanajuato, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
el salto, jalisco, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
playa del carmen, quintana roo, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
puebla de zaragoza, puebla, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
tlalnepantla de baz, estado de méxico Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
santiago de querétaro, querétaro, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
san luis potosí, san luis potosí, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
benito juárez, distrito federal, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...
-
rosales, chihuahua, México Lilt Inc. Jornada completaAbout The OpportunityWe are building a rigorous, verifiable evaluation suite of Terminal-Bench tasks designed to test the limits of large language models on multilingual software challenges. Our goal is to measure multilingual robustness across prompt language effects, non-English data processing, and complex locale/encoding edge cases in terminal...